Агент NVIDIA AVO прошёл все 183 уровня ARC-AGI-3 без единой подсказки

ARC-AGI-3 — набор интерактивных сред, где агенту не говорят ни правил, ни цели: он попадает в незнакомую игру и должен сам понять, что делать. NVIDIA сообщила, что её универсальный кодинг-агент AVO прошёл все 183 уровня в 25 публичных средах — то есть закрыл бенчмарк целиком.
Позавчера мы писали, как отдельный навык поднял Claude Opus на этом же наборе с 30 до 100 процентов, и это сместило разговор с моделей на обвязку — код вокруг модели, который ставит задачу и разбирает ответ. Автор ARC Майк Кнуп отреагировал прямо: люди явно хотят, чтобы следующая версия набора была трудной и для обвязок тоже.
NVIDIA AI@NVIDIAAI
Our general-purpose coding agent just scored 100% on the ARC-AGI-3 interactive reasoning benchmark. NVIDIA AVO completed all 183 levels across all 25 public environments, figuring out what to do with no instructions, explicit rules, or stated goals. https://t.co/UgROuDrMtn
5 09721 августа 2026
Что говорят
woeiruaHacker News
Я думал, ARC-AGI-3 — это тест именно сырых способностей модели, без обвязки. Возвращая обвязку, мы не узнаём ничего нового: что агенты с достаточной обвязкой умеют в длинные горизонты, известно давно — GPT-4 проходил покемонов ещё полтора года назад.
embedding-shapeHacker News
Ни в твитах, ни в пресс-релизе не сказано, сколько времени заняла оценка от начала до конца, зато сказано про «на 12% меньше действий». Подозрительно, что тайминги не раскрывают: судя по схеме, там много машинерии, а раз действий меньше, значит каждое обдумывается дольше.
magicalhippoHacker News
В блоге уточняют: основной публичный результат получен на Claude Opus 5, но AVO работает и с другими моделями. На части игр с GPT-5.6 Sol модель быстрее по реальному времени, а Opus тратит меньше действий на тех же уровнях.