Сервер vLLM переписали на C++: вместо окружения на Python один бинарник

vLLM — популярный сервер для запуска языковых моделей, написанный на Python. Разработчик выложил vllm.cpp: порт его серверной части на C++20, где при работе модели ни Python, ни PyTorch не нужны вовсе.
Бинарник занимает 66 МБ против примерно 9,1 ГБ виртуального окружения vLLM. Сохранены непрерывная пакетная обработка запросов, страничный кэш, кэш общих начал диалога, спекулятивное декодирование (черновая модель предсказывает, основная проверяет), загрузка форматов safetensors и GGUF, работа на CUDA, Metal и CPU, интерфейс, совместимый с OpenAI. Совпадение вывода проверено по идентификаторам токенов — они те же, что у оригинала.
По скорости паритет: на модели Qwen3.6-27B прирост составил от 0,7% до 4,5% при разбросе прогонов около 0,5%, то есть выигрыш заметен только на одиночном запросе. В обсуждении спрашивают про поддержку Vulkan, вынос части весов на CPU и сокращение многоминутного старта модели.