Вышел vLLM 0.28.0 — обновление движка для запуска моделей на своём железе

Вышел vLLM 0.28.0 — обновление движка, который запускает языковые модели на серверах и раздаёт ответы по запросам. Это один из двух основных открытых движков, на которых держится самостоятельный запуск моделей.
Выпуск добавляет поддержку свежих архитектур и правит производительность на многокарточных конфигурациях.
NVIDIA AI@NVIDIAAI
Already running an inference engine? So where does NVIDIA Dynamo fit in? In five minutes, we break down how Dynamo sits around engines like @sgl_project, @vllm_project and TensorRT-LLM to scale inference across GPUs and nodes. Full video in the comments 🔽 https://t.co/BA093Ab3gJ
29128 августа 2026
Что говорят
kouteiheikaHacker News
Люблю vLLM, но он до бешенства багованный. На v0.26 DeepSeek-V4-Flash на B300 был полностью сломан, пришлось накатывать три сторонних патча; на v0.27 патчи не нужны, зато модель периодически начинает выдавать мусор — зацикленные токены. А на рабочей станции с Gemma-4 на RTX 6000 процесс просто зависает и его приходится убивать и перезапускать.
Der_EinzigeHacker News
По поддержке сэмплеров всё ещё сильно отстают от llama.cpp. Где top-n-sigma? Где DRY? Где XTC?
SillyUsernameHacker News
Хотелось бы поддержки Pascal. Nvidia от него отказалась, но это же не значит, что vLLM обязан — llama.cpp вот не отказался.