Инженеры vLLM описали, как ускорить ответы моделей на видеокартах AMD

Инженеры vLLM — популярного движка для запуска языковых моделей — описали, как работает спекулятивное декодирование на видеокартах AMD. Приём такой: маленькая черновая модель быстро предсказывает несколько следующих токенов, а основная проверяет их одним проходом и принимает или отбрасывает.
Выигрыш в том, что проверка нескольких токенов сразу дешевле, чем генерация их по одному, а качество ответа не меняется — итог всё равно определяет основная модель. Разбор посвящён именно AMD: до сих пор такие оптимизации в первую очередь доводили под Nvidia, и обсуждение на Hacker News сводится к тому, насколько цифры воспроизводятся на чужом железе.