Cerebras выпустила CS-4: вдвое выше частота и вдвое быстрее ответы моделей
Cerebras делает ускорители размером с целую кремниевую пластину — один чип вместо стойки с обычными картами. Новый сервер CS-4 несёт три чипа WSE 3 Turbo, разогнанную версию прежнего WSE 3: частоту поднялa с 1,4 до 2,8 ГГц, вместе с ней удвоились пропускная способность памяти и число операций в секунду.
Отсюда обещание: модели отвечают вдвое быстрее, а для моделей на десять триллионов параметров компания заявляет больше тысячи токенов в секунду. Есть оговорка, которую видно из характеристик: памяти на чип осталось те же 44 гигабайта, поэтому такую модель придётся размазать по нескольким десяткам серверов CS-4.
Что говорят
9cb14c1ec0Hacker News
Напоминаю: мы всего в нескольких годах и 3-4 итерациях от начала оптимизации железа под LLM. За ближайшие пять лет стоит ждать улучшений на порядки по скорости и/или цене. Вот тогда и поговорим про «безлимитный интеллект» и про ценовые войны, когда средний пользователь ChatGPT будет обходиться компании в $0,10 в месяц.
OutOfHereHacker News
Через пять лет я не понимаю, кто вообще будет использовать Nvidia для инференса. Cerebras — только инференс, не обучение, и конкуренты у него есть, но для Nvidia в инференсе это плохой знак. За обучением роль, впрочем, останется.
syntaxingHacker News
Забавный вывод из этих цифр: у GPT 5.4, похоже, около 45 млрд активных параметров, а у GPT 5.6 Sol ближе к 50 млрд.