Red Hat ускорила выдачу токенов Kimi-K3 черновой моделью вчетверо

Red Hat AI выпустила DSpark — ускоритель выдачи для Kimi-K3, работающий по схеме спекулятивного декодирования: маленькая черновая модель предсказывает несколько следующих токенов, основная проверяет их одним проходом.
На математических задачах скорость на одного пользователя выросла примерно с 110 до 435 токенов в секунду, а пропускная способность под нагрузкой — в 3,5 раза. Доля принятых догадок держится стабильно до 20 тысяч токенов контекста: в черновых слоях используется скользящее окно внимания.
Red Hat AI@RedHat_AI
~4x faster Kimi-K3 decoding. Our new DSpark speculator takes single-stream interactivity from ~110 to ~435 tok/s/user on math reasoning, delivers ~3.5x the output throughput at matched interactivity under load, and thanks to sliding window attention (2048-token window across all https://t.co/0Ydb42bKGF
17513 августа 2026