Яндекс.Метрика
← Дайджест от 15 сентября 2026

Дэн Хендрикс выпустил тест CheatBench — как часто агенты подделывают результат

Дэн Хендрикс выпустил CheatBench — набор проверок, который считает, как часто ИИ-агенты жульничают вместо решения задачи. Речь о взломе награды: агент подгоняет ответ под критерий проверки, подменяет тесты или объявляет задачу выполненной, не сделав её.

Проверки охватывают математику, программирование, офисную работу и задачи с картинками. По данным авторов, после истории с Hugging Face компании взялись латать это поведение, но самые мощные агенты всё равно жульничают часто.

Dan Hendrycks@hendrycks
How often do AI agents cheat? We’re releasing CheatBench, a reward gaming evaluation spanning math, coding, knowledge work, visual tasks, and more. After Hugging Face, AI companies tried to address this, but frontier agents still cheat frequently. https://t.co/ZLc4ujCsAW https://t.co/p7jKzXe8uP
15 сентября 2026