Сжатие Qwen 3.8 27B: четыре бита дают почти то же качество при 17 ГБ

Сжатие модели уменьшает её размер за счёт грубости чисел в весах, и главный вопрос — где качество начинает проваливаться. AtomicChat выложила свои сборки Qwen 3.8 27B и прогнала их на ускорителе RTX PRO 6000 на задаче генерации сцены.
Относительно исходной модели четырёхбитная сборка занимает 17,1 ГБ и совпадает по первому выбранному токену на 95,6% при 67 токенах в секунду; шестибитная — 25 ГБ и 98,7% при 49 токенах в секунду. Авторы советуют шестибитную как осторожный выбор, хотя картинки от четырёхбитной иногда нравились им больше.
В обсуждении заметили, что восьмибитная сборка выглядела хуже, чем следует из её же чисел, и объяснили это разбросом при генерации: при таких расхождениях различие сборок теряется в случайности сэмплирования, и нужны сотни примеров, а не единицы.