Смена обвязки меняет точность агента на 15 пунктов при той же модели

Бенчмарк DataSpace проверял агентов для работы с данными: 410 задач на разных языках, 7439 файлов и 15 гигабайт структурированных и неструктурированных данных. Задача была отделить вклад самой модели от вклада обвязки — кода вокруг неё, который задаёт инструменты и разбирает ответы.
Главный результат: при одной и той же модели замена обвязки сдвигала точность на 15,36 пункта. Отдельно вышел Boundary-Bench — открытый набор задач, где агента проверяют в реальных корпоративных ограничениях: с системой защиты рабочих станций, сетевым шлюзом и контролем утечек данных. Авторы утверждают, что публичные таблицы лидеров меряют агентов в условиях, которые ни одна служба безопасности не разрешит.
Or Hiltch@_orcaman
Today we are open-sourcing @boundarybench, a new paper, benchmark, and GitHub repo that enterprises can use to find out the REAL performance of their agents. Boundary-Bench was developed by researchers from @Accomplish_ai and NYU, where we tested 12 frontier agents across https://t.co/EmOUPKjxsl
219 ♡
5 августа 2026