Cursor открыла мегаядро MoK для обучения MoE-моделей

Cursor открыла код Mixture-of-Kittens (MoK) — мегаядра для обучения моделей типа MoE, где на каждый токен работает лишь часть «экспертов». Обычно такое обучение упирается в пересылку данных между видеокартами: обмен и вычисления идут отдельными шагами.
MoK объединяет всю пересылку между картами в стойке Nvidia NVL72 и вычисления MoE-слоя в одно GPU-ядро, причём результат получается детерминированным. По собственным замерам Cursor, это до 2,37 раза быстрее сильных публичных решений. Проверить цифру смогут только те, у кого есть стойка такого класса.
Cursor@cursor_ai
We're open-sourcing Mixture-of-Kittens (MoK), our MoE training megakernel for NVL72s. It fuses all Mixture-of-Experts communication and computation into a single, fully deterministic kernel, and runs up to 2.37x faster than the strongest public baselines. https://t.co/yHu5E6RXp9
4 626 ♡
4 августа 2026