Яндекс.Метрика
← Дайджест от 4 сентября 2026

Модель Astra на низких рассуждениях оказалась вдвое точнее прежней — замер ARC Prize

Микe Кнуп из фонда ARC Prize опубликовал замер Astra на тесте ARC-v3 и обратил внимание на странность: на низких уровнях рассуждения модель часто выдаёт ноль токенов рассуждений на действие. Такого раньше не видели.

При этом Astra на низком уровне оказалась вдвое точнее предыдущей модели Sol на максимальном. Кнуп предполагает, что модель использует какой-то дополнительный механизм подстройки прямо во время решения, а не только цепочку рассуждений.

Эндрю Карр из системной карточки Astra вытащил другой график — устойчивость к подмене инструкций через содержимое страницы. По его словам, между Sol и Astra команда OpenAI что-то важное нашла, но и модели Claude с Gemini на этом графике выглядят хорошо.

Mike Knoop@mikeknoop
New chart from Astra testing on ARC v3 Astra often emits zero reasoning tokens per action at lower reasoning levels. We've never seen this before. And surprisingly Astra low is 2X more accurate than Sol max. This suggests Astra is leveraging a secondary test-time adaptation https://t.co/yuTzZn60MX
4 сентября 2026