Яндекс.Метрика
← Дайджест от 22 августа 2026

Инженер посчитал свой запуск моделей для 25 разработчиков и не нашёл экономии

Автор на Хабре развернул языковую модель внутри контура компании для 25 разработчиков и описал пять последовательных конфигураций: что каждая дала и чего стоила. В расчёт вошли флаги vLLM под одну карту Blackwell и пул KV-кэша — памяти, где хранится уже обработанный контекст диалога.

Соотношение 452:1 в заголовке разбора — это перевес входных токенов над выходными: агент перечитывает контекст многократно, а пишет мало, и именно это определяет требования к памяти.

Вывод автора против ожидания: запуск на своём железе денег не сэкономил. Причина запускать модель у себя остаётся одна — данные не уходят наружу.