Яндекс.Метрика
← Дайджест от 21 августа 2026

Scale AI выпустила бенчмарк, который проверяет, умеет ли модель переписывать чужого агента

Scale AI представила HarnessOpt-Bench — набор задач на то, насколько хорошо модель улучшает обвязку чужого ИИ-агента, то есть код вокруг модели: как формулируется задача, какие инструменты доступны, как разбирается ответ.

Устройство проверки такое. Модель-оптимизатор получает исходный код агента, размеченную обратную связь по прошлым прогонам и фиксированный бюджет. Она переписывает код и сдаёт финальную версию, которую прогоняют на отложенном наборе задач — его оптимизатор во время работы не видел. Выполнение идёт в изолированной среде.

Замер отвечает на вопрос, который в последние недели стоит ребром: сколько в результате агента от модели, а сколько от кода вокруг неё.