Яндекс.Метрика
← Дайджест от 5 августа 2026

В llama.cpp предложили кешировать горячих экспертов MoE в видеопамяти

В llama.cpp — популярной программе для запуска моделей на своём железе — предложили правку, которая отслеживает, какие «эксперты» MoE-модели выбираются чаще всего, и держит именно их в видеопамяти, оставляя остальные на процессоре. В моделях типа MoE на каждый токен работает лишь малая часть весов, поэтому при нехватке видеопамяти большая часть модели обычно лежит в оперативной.

На Qwen3.6-35B-A3B с 8 гигабайтами видеопамяти скорость выросла с 33,25 до 56 токенов в секунду при сильном сжатии и с 17,34 до 35,93 при более щадящем. Но на Qwen3.5-122B-A10B и Laguna-S-2.1 результат ухудшился: выигрыш зависит от того, насколько устойчиво модель переиспользует одних и тех же экспертов.

Правка пока не принята: она работает только на видеокартах Nvidia и только при генерации ответа, а по объёму трогает 23 файла и добавляет 1347 строк — сопровождающие сомневаются, что такое можно влить целиком.