Автор на Хабре пробовал ужать модель LLaMA-7B с 13 до 1 ГБ без дообучения
Автор на Хабре описал попытку ужать LLaMA-7B с 13 ГБ до 1 ГБ без дообучения. То есть он не обучал маленькую модель заново и не заставлял её копировать большую, а искал более короткую запись тех же весов. За экспериментом стоит больше шестидесяти прогонов.
Рядом вышел разбор другой стороны той же проблемы: у гибридной Qwen3.8-27B веса в четырёхбитном сжатии занимают около 14,3 ГБ. Но при длинном контексте память съедает кэш ключей и значений: на слоях полного внимания каждый токен добавляет 65 536 байт, и на 64 тысячах токенов это около 4 ГиБ сверх весов.