Яндекс.Метрика
← Дайджест от 17 августа 2026

Qwen3.8-27B набрала 52 балла и встала рядом с моделями на триллионы параметров

Вчера мы писали о выходе Qwen3.8-27B под лицензией Apache. Теперь появились замеры: Artificial Analysis поставила модели 52 балла в своём сводном индексе из девяти тестов — от программирования в терминале до вопросов по естественным наукам, — и это уровень DeepSeek V4 и GPT-5.6 Luna Max, то есть систем на порядки большего размера.

Симон Уиллисон, написавший разбор модели, отмечает и обратную сторону: по умолчанию она думает слишком долго. В отдельном замере на генерации картинки в формате SVG режим максимальных рассуждений дал лучшую оценку, но потратил 39 398 токенов рассуждений и почти 718 секунд против 112 секунд на низком режиме. Пользователи просят промежуточный режим: разрыв между «средним» и «максимальным» примерно десятикратный.

Есть и скепсис: типовые задачи вроде «сделай клон Galaga» и «нарисуй пеликана на велосипеде» много раз встречались в обучающих данных, поэтому проверяют скорее воспроизведение известного, чем новое рассуждение.

Что говорят
andy99Hacker News
Главная проблема «переразмышления» у плотной модели — скорость. Переход с Qwen 35BA3B на 27B у меня примерно в 7–8 раз медленнее, поэтому терпеть бесполезные токены рассуждений совсем не хочется. Хотелось бы сравнить с новой Muse 30B: она предельно лаконична, никаких «Wait,», и по расходу токенов настолько эффективнее, что абсолютные tok/s уже не так важны.
SwellJoeHacker News
Я дал ей задачу, которую прогонял через кучу небольших моделей, и справилась она отлично — лучше любой self-hosted модели. Но на моей системе с двумя GPU это заняло одиннадцать (11!) часов: она долго жевала, перепроверяла и перепроверяла. GPT 5.5 делает похожее за 20 минут, большие модели — примерно за час.
deadcatfoundHacker News
Для агентов экономия токенов — это операционные расходы. Лучше лаконичная модель, которая эскалирует сложные случаи, чем та, что переразмышляет над каждым вызовом инструмента.