Яндекс.Метрика
← Дайджест от 26 августа 2026

Qwen выложила Qwen3.8-Flash-Next — превью архитектуры следующего поколения

Вчера мы писали про отсчёт на ModelScope — сегодня модель выложена. Qwen3.8-Flash-Next — это 125 млрд параметров, из которых на токен работают около 6 млрд, плюс отдельная таблица n-грамм на 51 млрд параметров: она хранит частые словосочетания и её можно держать в обычной оперативной памяти, а не в видеопамяти. Контекст — 262 тысячи токенов, с расширением до миллиона.

Архитектура новая: гибрид Gated DeltaNet и разреженного внимания Qwen, гейтованные остаточные связи, эмбеддинги n-грамм и оптимизатор Muon. Обучение, по данным команды, обошлось примерно в девять раз дешевле, чем у Qwen3.7-Plus. Поддержка в vLLM и SGLang есть с первого дня.

На практике формат оказался удобен для домашних машин: пользователь прогнал FP8-версию на двух картах RTX PRO 6000 с таблицей n-грамм в системной памяти и получил 123–126 токенов в секунду генерации после смены режима черновой генерации. По официальным замерам модель уступает GLM-5.3-Flash почти везде, кроме GPQA Diamond, где счёт практически равный.