Prime Intellect открыла рекорды скоростного обучения NanoGPT

NanoGPT Speedrun — соревнование, где надо обучить маленькую языковую модель до заданного качества за минимальное время на фиксированном железе. Смысл в том, что улучшения тут чисто инженерные: архитектура, оптимизатор, работа с памятью, — и они переносятся на большие обучения.
Prime Intellect опубликовала NanoGPT Speedrun Frontier — площадку, где собраны лучшие результаты и приёмы, которыми они получены. Это делает разрозненные рекорды из чужих репозиториев сравнимыми между собой: видно, какой приём сколько времени сэкономил.
Что говорят
totetsuHacker News
«Мы провели 153 автономных прогона на 18 фронтир-моделях в спидране оптимизатора nanoGPT». Ладно, а что такое прогон и при чём тут способность вести исследования? И почему для понимания меня отсылают смотреть, что там делает Anthropic в своей внутренней оценке, вместо того чтобы объяснить это прямо в блоге?
vibe42Hacker News
Пишут, что почти все модели находят одни и те же выигрышные идеи, а отличает лучших умение достаточно долго удерживать слабые сигналы и понимать результаты. Интересно, изменил бы исход харнесс, который сам сохраняет такие сигналы в журнал истории, или иные формулировки цели — не промпт-инжиниринг, а мелкие правки вроде «ищи нестандартные решения, отслеживай слабые сигналы». Мне кажется, они потратили уйму GPU-времени на один и тот же промпт.
ninjahawk1Hacker News
Может, я пропустил, но почему Fable 5 тестировали на high, а Opus 5 — на max? Похоже, у части моделей настройки усилий вообще не совпадают, и кто-то сочтёт это ошибкой эксперимента.