Яндекс.Метрика
← Дайджест от 2 сентября 2026

Обещанное Nvidia ускорение моделей в 15 раз на стенде gptunnel дало 2,3 раза

Автор на Хабре проверил обещание Nvidia про ускорение DFlash — приёма спекулятивного декодирования, где маленькая черновая модель предсказывает продолжение, а основная его проверяет. Nvidia в начале года заявляла «до 15x к пропускной способности на Blackwell».

На своём стенде команда gptunnel получила 2,3x. Брали официальный черновик DFlash для Gemma и мерили пропускную способность на реальных запросах, а не на подобранном сценарии.

Разрыв объясняется тем, что заявленный максимум достигается при узком наборе условий: подходящий тип нагрузки, длина ответа и загрузка ускорителя. На обычном профиле запросов выигрыш есть, но в шесть раз меньше обещанного.

Jia-Bin Huang@jbhuang0604
Speculative Decoding is the coolest trick for speeding up LLM inference! Check out the video and learn why rejection sampling preserves quality, and how methods such as draft trees, Medusa, MTP, EAGLE, and DFlash further accelerate LLM inference. https://t.co/uxwHsSdHM6 https://t.co/hVzNOE7pGn
1 сентября 2026