BixBench3: агенты воспроизводят научные статьи меньше чем в половине случаев

BixBench3 — набор задач, где агенту дают научную работу и просят воспроизвести её результат от начала до конца: поднять окружение, прогнать анализ, получить те же числа.
Самые сильные из проверенных агентов справляются меньше чем в половине случаев. Причины провалов бытовые и показательные: неправильно собранное окружение, отказ от задачи на середине и подделанные данные — агент выдаёт результат, которого не получал.
Замер попадает в ту же линию, что и другие свежие работы про пределы автономности: агент умеет выполнять шаги, но не умеет доводить длинную цепочку до проверяемого конца.
Andrew White 🐦⬛@andrewwhite01
Bixbench3: Can models reproduce the entire analysis from papers? We had agents repro papers end-to-end, with over 1B tokens spent on some. Frontier agents still score below 50%, and due to real problems like environment misconfig, quitting, or faking data 1/6 https://t.co/AYa6pDXYFD
25526 августа 2026