Яндекс.Метрика
← Дайджест от 5 августа 2026

Смена обвязки меняет точность агента на 15 пунктов при той же модели

Бенчмарк DataSpace проверял агентов для работы с данными: 410 задач на разных языках, 7439 файлов и 15 гигабайт структурированных и неструктурированных данных. Задача была отделить вклад самой модели от вклада обвязки — кода вокруг неё, который задаёт инструменты и разбирает ответы.

Главный результат: при одной и той же модели замена обвязки сдвигала точность на 15,36 пункта. Отдельно вышел Boundary-Bench — открытый набор задач, где агента проверяют в реальных корпоративных ограничениях: с системой защиты рабочих станций, сетевым шлюзом и контролем утечек данных. Авторы утверждают, что публичные таблицы лидеров меряют агентов в условиях, которые ни одна служба безопасности не разрешит.

Or Hiltch@_orcaman
Today we are open-sourcing @boundarybench, a new paper, benchmark, and GitHub repo that enterprises can use to find out the REAL performance of their agents. Boundary-Bench was developed by researchers from @Accomplish_ai and NYU, where we tested 12 frontier agents across https://t.co/EmOUPKjxsl
219
5 августа 2026