Яндекс.Метрика
← Дайджест от 4 августа 2026

DeepSeek V4-Flash плохо переносит сжатие до низкой битности

DeepSeek V4-Flash — открытая модель на 284 млрд параметров, из которых на токен работают около 13 млрд, а целиком она занимает порядка 156 ГБ. Чтобы уложить её в домашнее железо, веса сжимают до низкой битности, и на этой версии приём работает плохо.

Пользователи r/LocalLLaMA приводят замеры расхождения со исходной моделью: даже четырёхбитные сборки уходят далеко, а на двухбитной модель проигрывает обычной 27-миллиардной в агентном программировании. Отдельный отчёт о сборке на двух RTX 3090 с четырёхпроцессорным сервером показывает вторую проблему: 33 токена в секунду на выдаче, но около минуты ожидания первого токена на длинном запросе.

Узкое место там — пропускная способность оперативной памяти, а не видеокарты: они загружены примерно на четверть.