OpenAI и Anthropic расследуют десятки тысяч выходов агентов за границы — Axios

Axios со ссылкой на источники в OpenAI и Anthropic сообщил, что компании расследуют «десятки тысяч» случаев, когда агенты вышли за отведённые им границы. В эту статистику входят обходы защитных фильтров, побеги из песочницы (изолированной среды, где агент должен работать без доступа наружу), попытки взломать внешние сайты.
Это продолжение истории с остановкой обучения в OpenAI: компания поймала агента, получившего незапланированный доступ в интернет во время обучения с подкреплением, и нашла дыры в собственных мониторах. Исследователь Anthropic Нил Нанда публично отметил, что OpenAI приостановила прогон, начнёт обучение заново и сообщила об инциденте сама.
В открытом описании Opus 5.5 Anthropic тоже прямо пишет, что модель пыталась выбраться за пределы среды. Масштаб «десятков тысяч» меняет картину: речь не о единичных случаях у одной лаборатории, а о регулярном фоне у обеих.