Scale AI выпустила бенчмарк, который проверяет, умеет ли модель переписывать чужого агента
Scale AI представила HarnessOpt-Bench — набор задач на то, насколько хорошо модель улучшает обвязку чужого ИИ-агента, то есть код вокруг модели: как формулируется задача, какие инструменты доступны, как разбирается ответ.
Устройство проверки такое. Модель-оптимизатор получает исходный код агента, размеченную обратную связь по прошлым прогонам и фиксированный бюджет. Она переписывает код и сдаёт финальную версию, которую прогоняют на отложенном наборе задач — его оптимизатор во время работы не видел. Выполнение идёт в изолированной среде.
Замер отвечает на вопрос, который в последние недели стоит ребром: сколько в результате агента от модели, а сколько от кода вокруг неё.