Cerebras запустила открытую модель Qwen 3.8 27B на чипе размером с пластину

Cerebras открыла доступ к открытой модели Qwen 3.8 27B на своём железе со скоростью около 1500 токенов в секунду. Cerebras делает ускорители из одного огромного чипа размером с кремниевую пластину: модель целиком помещается в память чипа, и генерация идёт быстрее, чем на связке отдельных ускорителей.
Qwen 3.8 27B можно скачать и запустить у себя, но такого темпа на обычных ускорителях не получить. Обсуждение на Hacker News собрало 154 комментария.
Что говорят
gardnrHacker News
Несколько месяцев пользовался их Coding Plan — за моделями реально не успеваешь, а выдача безумно быстрая. Qwen 3.8 27B, похоже, сильнейшая из всего, что они хостили; правда, доступна только по API-тарифу — кто-нибудь знает, завезли ли уже кэширование промптов? Без него агентное кодирование выходило дорого.
porphyraHacker News
Почему они хостят только небольшие модели, а не версию на 2,4T? Дело в том, что ввод-вывод и интерконнект между пластинами слабые из-за ограниченного периметра относительно огромной площади чипа?