Яндекс.Метрика
← Дайджест от 3 августа 2026

AirLLM запускает модель на 70 млрд параметров на карте с 4 ГБ

Проект AirLLM за день собрал больше тысячи звёзд на GitHub. Он позволяет выполнять запросы к модели на 70 млрд параметров на видеокарте с четырьмя гигабайтами памяти — при обычном подходе для такой модели нужны десятки гигабайт.

Приём в том, что слои модели загружаются в память по очереди: посчитали один — выгрузили, взяли следующий. Память перестаёт быть ограничением, но каждый ответ требует пересылки весов, поэтому скорость падает многократно.

В ту же сторону движется Swiftlet — проект с Show HN, который запускает модель Qwen на 80 млрд параметров в 4,3 ГБ оперативной памяти на Mac, а версию на 35 млрд — на iPhone.