Яндекс.Метрика
← Дайджест от 24 августа 2026

vLLM: скорость агента держится на переиспользовании кэша, а не на токенах в секунду

Обычные замеры серверов моделей считают токены в секунду на одном обращении. Агент работает иначе: десятки ходов по одному и тому же коду, и каждый ход тащит за собой всю предыдущую переписку.

Проект vLLM опубликовал результаты AgentX 1.0 на реальных многоходовых записях работы с кодом. Главными рычагами названы вынос кэша ключей и значений из памяти ускорителя, переиспользование общего начала запроса и разделение этапов: разбор входного текста и генерация ответа выполняются отдельно.

Ту же проблему видно с другой стороны в жалобах пользователей: если сервер выбросил кэш сессии, он минутами пересчитывает прежний контекст до первого нового токена. В домашнем замере переиспользование общего начала сократило повторный разбор двухсоттысячного контекста примерно со 157 секунд до 2,5.

vLLM@vllm_project
Congratulations to @SemiAnalysis_ on the release of AgentX 1.0 🎊, an open-source multi-turn agentic coding benchmark collected from ~$3M of real traces, running on 1000+ chips and ~2MW of continuously operated compute. We are excited to see @vllm_project’s competitive https://t.co/1JA2nwBZGt https://t.co/QOyFptkjLV
25 августа 2026