Wafer.ai: Kimi K3 на MI355X дешевле на запрос, чем на B300
Обслуживать K3 дорого из-за размера, и главный вопрос для тех, кто её ставит, — на каком железе выходит дешевле. Команда Wafer.ai сравнила ускорители AMD MI355X и Nvidia B300 на одной и той же модели.
По их замерам, у AMD лучше отношение производительности к стоимости: карты дают больше памяти на ускоритель, а значит модель требует меньше карт и меньше обмена между ними. Абсолютная скорость на B300 при этом выше.
В обсуждении на Hacker News спорят о честности сравнения: цены аренды у разных провайдеров расходятся, и итог сильно зависит от того, чей прайс взяли за основу.
Что говорят
villgaxHacker News
Статья написана крайне халтурно: 8× MI355X против B300 — 118 против 172 ток/с на поток, 952 против 1568 в сумме, 119 против 196 на GPU. B300 выигрывает в каждой строке. Модель принудительно сравнивают с тем, что не влезает в память одной ноды, деталей про межнодовые соединения и disagg нет, а единственная победа — цена за час по одному сайту аренды.
logicalleeHacker News
Вот эта фраза звучит как «настраивали и бенчмаркали с помощью ИИ»: «Починка была тривиальной: добить число голов с 12 до 16 нулями, запустить быстрое ядро и вытащить из вывода настоящие 12 голов». Я недавно так настраивал куда меньшую локальную модель через фронтирную модель, и её оптимизации сделали модель полностью бессвязной — она просто повторяла один символ. Поэтому и возникает вопрос, осталась ли их сборка вообще эквивалентной штатной установке Kimi K3.
inferencecoderHacker News
Wafer становится синонимом шлака в инференсе: раздутые нечестные сравнения во всех результатах, хайповые твиты с эмодзи-сиренами. «$2,50/GPU-час за MI355X, $6,00 за B300, $4,25 за B200» — это не реальные рыночные цены.