Cloudflare рассказала, как обслуживает Kimi и GLM в своей сети
Cloudflare выпустила разбор того, как запускает у себя открытые модели Kimi и GLM для платформы Workers AI. Задача была в том, чтобы крупные открытые модели ехали на распределённой сети серверов, а не на выделенном кластере под одну модель.
Компания описывает три направления: уменьшение моделей за счёт квантизации — снижения точности чисел в весах, ускорение выдачи токенов и фильтрацию входа-выхода. Отдельно в блоге вышел интерфейс для программного получения счёта за потребление, чтобы стоимость запусков была видна в цифрах, а не в конце месяца.
Подробные замеры компания приводит по своей инфраструктуре, так что переносить их на своё железо напрямую нельзя.
Что говорят
scrlkHacker News
Приятно видеть провайдера, который открыто говорит о квантовании KV-кэша — подозреваю, некоторые делают это молча, рекламируя «неквантованные веса», хотя квантование KV может портить качество сильнее, чем квантование весов. Но тестов мало: проверили только Kimi K2.6, а в наборе оценок явно не хватает кодовых бенчмарков, где мелкие ошибки в вызовах инструментов накапливаются в длинных задачах.
lostmsuHacker News
Итог: модели квантуют, сообщают об этом только в блоге, а не предупреждением на странице модели, и там же делают вид, что разницы нет, замеряя короткий контекст на уже насыщенных задачах. Продавать квантованные модели, не указав этого на странице «магазина», я бы назвал мошенничеством.
syntaxingHacker News
«Смотрите цены в дашборде Cloudflare» — зачем так? Я хотел понять, стоит ли использовать их endpoint, а цену даже не увидеть.