vLLM: скорость агента держится на переиспользовании кэша, а не на токенах в секунду

Обычные замеры серверов моделей считают токены в секунду на одном обращении. Агент работает иначе: десятки ходов по одному и тому же коду, и каждый ход тащит за собой всю предыдущую переписку.
Проект vLLM опубликовал результаты AgentX 1.0 на реальных многоходовых записях работы с кодом. Главными рычагами названы вынос кэша ключей и значений из памяти ускорителя, переиспользование общего начала запроса и разделение этапов: разбор входного текста и генерация ответа выполняются отдельно.
Ту же проблему видно с другой стороны в жалобах пользователей: если сервер выбросил кэш сессии, он минутами пересчитывает прежний контекст до первого нового токена. В домашнем замере переиспользование общего начала сократило повторный разбор двухсоттысячного контекста примерно со 157 секунд до 2,5.