Яндекс.Метрика
← Дайджест от 5 августа 2026

Qwen раскрыла планы: следующая большая модель на 2,4 трлн параметров

Команда Qwen провела публичную сессию вопросов и ответов и приоткрыла план выпусков. Ближайшая модель — Qwen 3.8 27B, дальше идёт вариант MoE на 2,4 триллиона параметров всего и 95 миллиардов активных на токен, то есть при работе задействуется около четырёх процентов весов.

Архитектура, по словам разработчиков, близка к прошлому поколению, упор сделан на обучение с подкреплением после основного обучения и на иерархическую память для видео длиной более ста часов. Отдельно дали совет по сжатию: держать проекции внимания в 16 битах, а полносвязные слои сжимать до 4 бит.

Сообщество осталось недовольно: на вопросы о модели на 122 миллиарда параметров и о промежуточных размерах внятных ответов не дали, а многие реплики свелись к «присылайте пожелания».