Qwen3.8-27B набрала 52 балла и встала рядом с моделями на триллионы параметров

Вчера мы писали о выходе Qwen3.8-27B под лицензией Apache. Теперь появились замеры: Artificial Analysis поставила модели 52 балла в своём сводном индексе из девяти тестов — от программирования в терминале до вопросов по естественным наукам, — и это уровень DeepSeek V4 и GPT-5.6 Luna Max, то есть систем на порядки большего размера.
Симон Уиллисон, написавший разбор модели, отмечает и обратную сторону: по умолчанию она думает слишком долго. В отдельном замере на генерации картинки в формате SVG режим максимальных рассуждений дал лучшую оценку, но потратил 39 398 токенов рассуждений и почти 718 секунд против 112 секунд на низком режиме. Пользователи просят промежуточный режим: разрыв между «средним» и «максимальным» примерно десятикратный.
Есть и скепсис: типовые задачи вроде «сделай клон Galaga» и «нарисуй пеликана на велосипеде» много раз встречались в обучающих данных, поэтому проверяют скорее воспроизведение известного, чем новое рассуждение.