Инженер посчитал свой запуск моделей для 25 разработчиков и не нашёл экономии
Автор на Хабре развернул языковую модель внутри контура компании для 25 разработчиков и описал пять последовательных конфигураций: что каждая дала и чего стоила. В расчёт вошли флаги vLLM под одну карту Blackwell и пул KV-кэша — памяти, где хранится уже обработанный контекст диалога.
Соотношение 452:1 в заголовке разбора — это перевес входных токенов над выходными: агент перечитывает контекст многократно, а пишет мало, и именно это определяет требования к памяти.
Вывод автора против ожидания: запуск на своём железе денег не сэкономил. Причина запускать модель у себя остаётся одна — данные не уходят наружу.