Команда Qwen во вторник выложит Qwen3.8-Flash-Next на архитектуре следующего поколения

На ModelScope появился отсчёт до релиза Qwen3.8-Flash-Next — модели на 125 млрд параметров, из которых на каждый запрос работают около 6 млрд. Это первая модель на архитектуре нового поколения, на которой затем построят Qwen-4.
Деталей команда пока не раскрыла: сообщается только, что изменения затронули механизм внимания, остаточные связи, слои эмбеддингов и оптимизацию обучения. Страница модели собрала 312 очков на Hacker News.
Что говорят
ddtaylorHacker News
Модели Qwen мне нравятся, но строить на них что-то через OpenRouter — боль: у многих Qwen почти нет мощностей или они настолько нестабильны, что приходится засорять код чёрными и белыми списками провайдеров. У OpenRouter есть попытки это решить, но они не работают.
big-chungus4Hacker News
«Мы выпускаем архитектурные улучшения заранее, чтобы сообщество подготовилось к полному семейству Qwen4» — надеюсь, «полное семейство» означает, что будут и маленькие модели вроде 4B.
pwythonHacker News
Я и так присматривался к MacBook Pro на M5 Max с 128 ГБ, а теперь ещё и это. 4-битный MLX-квант с окном 128k должен идеально влезть, где-то 50–70 токенов в секунду.