Яндекс.Метрика
← Дайджест от 23 августа 2026

Разбор FreeToken: как запустить модель на 753 млрд параметров на одной карте

Обычно большую модель либо целиком грузят в память ускорителя, либо не запускают вовсе: моделям вроде 753-миллиардной нужны десятки дорогих карт. Автор Хабра разбирает FreeToken — подход, который позволяет держать такую модель на одной потребительской видеокарте вроде RTX 4060 за счёт того, что в памяти лежит не вся сеть.

В разборе показано, какой ценой это достаётся: скорость ответа падает, часть весов приходится подгружать с диска и из оперативной памяти, а требования к диску растут. Автор отдельно спорит с популярным способом ускорения — грубым сжатием кэша внимания: память экономится, но модель начинает терять содержание диалога.