Яндекс.Метрика
← Дайджест от 12 августа 2026

Разреженные модели недобирают полтора раза на RTX 5090 не из-за маршрутизации

Автор на Хабре замерил, почему разреженные модели (MoE — на каждый запрос работает лишь часть параметров) на потребительской карте идут медленнее ожидаемого. Условия одинаковые: RTX 5090, одна сборка llama.cpp, один драйвер, батч 1.

Плотная Qwen3.5-9B выбирает 72% пропускной способности памяти карты, а MoE Qwen3.5-35B-A3B на той же карте — только 41%. Обычное объяснение через маршрутизацию экспертов не подтвердилось: ядра выбора top-k занимают 7% времени. Значит, потеря в полтора раза сидит в другом месте конвейера, а не в самом механизме разреженности.