Яндекс.Метрика
← Дайджест от 9 сентября 2026

Автор на Хабре пробовал ужать модель LLaMA-7B с 13 до 1 ГБ без дообучения

Автор на Хабре описал попытку ужать LLaMA-7B с 13 ГБ до 1 ГБ без дообучения. То есть он не обучал маленькую модель заново и не заставлял её копировать большую, а искал более короткую запись тех же весов. За экспериментом стоит больше шестидесяти прогонов.

Рядом вышел разбор другой стороны той же проблемы: у гибридной Qwen3.8-27B веса в четырёхбитном сжатии занимают около 14,3 ГБ. Но при длинном контексте память съедает кэш ключей и значений: на слоях полного внимания каждый токен добавляет 65 536 байт, и на 64 тысячах токенов это около 4 ГиБ сверх весов.