Яндекс.Метрика
← Дайджест от 8 сентября 2026

Модель Qwen3.8 держит умеренное сжатие и разваливается от предельного — замер Quesma

Quesma прогнала квантованные версии открытой модели Qwen3.8 27B через набор тестов и показала, где проходит граница. Квантование — это сжатие модели за счёт огрубления чисел внутри неё: чем меньше бит на число, тем меньше памяти нужно и тем быстрее ответ.

При 4 битах качество держится и остаётся близким к исходному. При 1 бите модель разваливается: результат падает не постепенно, а обвально. Разбор собрал 218 очков на Hacker News, где обсуждают, что именно ломается на низкой битности.

Что говорят
spider-marioHacker News
«Кроме шума (полосы — доверительные интервалы Уилсона, очень консервативные для разброса между запусками)» — доверительные интервалы вообще не про разброс между запусками. Им приписывают массу свойств, которых у них нет, но к вариативности прогонов они относятся меньше всего.
bellowsgulchHacker News
Qwen3.8 27B явно задумывалась как топовая открытая модель для потребителей, но на моём старом M1 Max с 64 ГБ скорость такая низкая, что я надеюсь хоть кому-то она полезна. Расклад изменился: дешевле взять MiMo V2.5 за копейки или DeepSeek V4 Flash, если только не нужна именно локальная модель для реверс-инжиниринга, который иначе отклоняют.
purpleflame1257Hacker News
Настоящая дыра здесь — на Q3. Критическая точка — карты меньше 16 ГБ, а это 5080, 5070 Ti, 5060 Ti и ещё несколько из этого и прошлого поколения. Было бы полезно увидеть, где именно ломается качество.