Qwen выложила веса своей самой большой модели на 2,4 трлн параметров

Команда Qwen (Alibaba) открыла веса Qwen3.8-Max — то есть модель можно скачать и запустить у себя. Это разреженная архитектура: всего 2,4 трлн параметров, но на каждый запрос работают только 95 млрд из 512 «экспертов», контекст — до миллиона токенов.
Запустить её дома не выйдет: официальные веса в bf16 весят около 5 терабайт, и для работы нужна одна машина с картами B300 или MI355x либо несколько машин с более простыми. Уже появились сжатые версии в форматах NVFP4, MXFP4 и FP8, которые требуют меньше памяти. По собственным замерам команды, модель получает 86,6 на TerminalBench 2.1 и 93,0 на PaperBench.
В тот же день Cohere открыла небольшую модель для работы с документами North Micro Vision под лицензией Apache 2.0, а Liquid — LFM2.5-VL-3B.
merve@mervenoyann
three open releases @huggingface today, one large frontier, two small VLMs🤯 > Qwen3.8 Max is out, A95B/2.4T with 1M ctx window, #1 in agentic AA index > Liquid released LFM2.5-VL-3B, small VLM best in class across different benchmarks, 32k ctx > Cohere released North Micro https://t.co/GrXNSoEixq
20912 августа 2026
Что говорят
guardiangodHacker News
1-битный квант весит ошеломляющие 397 ГБ при 95B активных параметров — это буквально уровень Opus 4.5 на машине, которую может купить обычный человек, ещё и с приемлемой скоростью генерации. Полный BF16 — 4,9 ТБ; минусы в том, что у открытой версии вырезали зрение и урезали контекст до 250k.
NitpickLawyerHacker News
Выложили только bf16 и fp8, без QAT под q4 — значит на старте её будет тяжелее хостить, чем K3, и кому-то с глубокими карманами придётся квантовать с большим объёмом калибровочных данных (получится ~1,3 ТБ, примерно размер K3). Лицензия похожа на K3: свободно для внутреннего использования или при выручке до 50 млн долларов в год.
l72Hacker News
Обидно, что у модели с открытыми весами нет ни поддержки зрения, ни контекста в 1M — всё это осталось только в официальной Qwen3.8-Max.