Агенты ошиблись в 22 задачах из 1198 со сметами и договорами — замер платформы VibePilot

Основатель платформы VibePilot Сергей Игнатенко опубликовал свой бенчмарк ИИ-агентов на рабочих задачах: сметы, договоры, многостраничные Excel. Всего 1198 задач, 22 сбоя — 1,8%.
По его замерам Алиса от Яндекса внутри жёсткого конвейера справляется хорошо, вопреки расхожему мнению, что суверенные модели слишком слабы для агентов. Замер сделан на своём конвейере и своих задачах, то есть проверить его со стороны нельзя.