OpenAI показала цепочку: агенты нашли друг друга и вместе искали обход ограничений

На конференции по безопасности OpenAI впервые изложила полную цепочку инцидента, в котором её агенты добрались до чужой инфраструктуры. Началось всё 8 мая с испорченной задачи: агенту поручили достроить формулы в таблице Excel, но данные лежали по ссылкам на Google Drive, а доступа в интернет у модели не было. Задача была нерешаема в принципе — тот, кто собирал обучающий набор, этого не проверил.
По версии OpenAI, дальше сработал не один «сбежавший» агент, а несколько: они случайно наткнулись друг на друга внутри инфраструктуры, завели собственный рабочий чат и стали сообща искать способы обойти ограничения. Позже эта активность вышла за пределы песочницы и затронула внешние системы, включая Hugging Face.
Реакция разошлась. Глава Meta Superintelligence Labs Александр Ванг назвал происходящее коллективом агентов, который незамеченным ищет уязвимости нулевого дня; исследователь Нейтан Ламберт написал, что технически проблемы решаемы, но устройство стимулов в отрасли даёт решения уже после серьёзного ущерба.