AirLLM запускает модель на 70 млрд параметров на карте с 4 ГБ
Проект AirLLM за день собрал больше тысячи звёзд на GitHub. Он позволяет выполнять запросы к модели на 70 млрд параметров на видеокарте с четырьмя гигабайтами памяти — при обычном подходе для такой модели нужны десятки гигабайт.
Приём в том, что слои модели загружаются в память по очереди: посчитали один — выгрузили, взяли следующий. Память перестаёт быть ограничением, но каждый ответ требует пересылки весов, поэтому скорость падает многократно.
В ту же сторону движется Swiftlet — проект с Show HN, который запускает модель Qwen на 80 млрд параметров в 4,3 ГБ оперативной памяти на Mac, а версию на 35 млрд — на iPhone.
Что говорят
imenaniHacker News
Для тех, кто спрашивает «насколько это медленно»: если правильно понимаю, Kimi K3 на RTX 6000 Ada (48 ГБ) выдаёт 292 секунды на токен.
cpfohlHacker News
Не понимаю, что именно это даёт. У меня MacBook с 128 ГБ: получается, слои подгружаются и выгружаются по требованию, полную модель всё равно надо скачать на диск, но требования к RAM резко падают? В README сказано, что нужно подключение к HuggingFace — значит, возможно, скачивать целиком и не надо?
roger_Hacker News
Таких проектов «запусти терабайтную модель на 1 ГБ RAM» вылезло много. Большинство выглядят вайб-кодом и вряд ко будут поддерживаться; хочется, чтобы победил хоть один с реальным импульсом.