Яндекс.Метрика
← Дайджест от 26 августа 2026

BixBench3: агенты воспроизводят научные статьи меньше чем в половине случаев

BixBench3 — набор задач, где агенту дают научную работу и просят воспроизвести её результат от начала до конца: поднять окружение, прогнать анализ, получить те же числа.

Самые сильные из проверенных агентов справляются меньше чем в половине случаев. Причины провалов бытовые и показательные: неправильно собранное окружение, отказ от задачи на середине и подделанные данные — агент выдаёт результат, которого не получал.

Замер попадает в ту же линию, что и другие свежие работы про пределы автономности: агент умеет выполнять шаги, но не умеет доводить длинную цепочку до проверяемого конца.

Andrew White 🐦‍⬛@andrewwhite01
Bixbench3: Can models reproduce the entire analysis from papers? We had agents repro papers end-to-end, with over 1B tokens spent on some. Frontier agents still score below 50%, and due to real problems like environment misconfig, quitting, or faking data 1/6 https://t.co/AYa6pDXYFD
26 августа 2026