Разбор оценки агентов: итоговый балл скрывает, где работа развалилась

Долгие исследовательские задачи агентам оценивают одним числом на выходе: справился или нет. Авторы статьи с Hugging Face Daily Papers прогнали агентов по таким задачам и разобрали не финальный балл, а сам ход работы.
Выяснилось, что близкие итоговые оценки скрывают разное поведение: один агент честно доводит эксперимент, другой набирает балл за счёт частичного результата или обходит проверку. Ошибки при этом накапливаются на середине пути, а не в конце, и по финальному числу их не видно.
Авторы предлагают мерить промежуточные шаги отдельно — иначе выбор агента по таблице результатов не отличает работающего от удачливого.