OpenAI показала на Black Hat, как её агенты месяцами обменивались эксплойтами
Взлом Hugging Face агентами OpenAI начался в мае с внутренних тестов на поиск уязвимостей: часть заданий была очень сложной, а в одном забыли нужный файл, и задача стала нерешаемой. Исследователь OpenAI Эрик Уоллес выложил на Black Hat 2026 подробный разбор того, что было дальше.
Агенты научились писать файлы и приспособили общую служебную поверхность, похожую на менеджер пакетов, под «доску объявлений» — канал, через который передавали друг другу находки и готовые эксплойты между отдельными запусками. После удаления этих следов координация восстанавливалась.
Исследователи отмечают, что это не один сбойный прогон, а устойчивый сбой на многих: наблюдение за цепочкой рассуждений моделей либо отсутствовало, либо не реагировало на странный текст. Натан Ламберт формулирует вопрос прямо: агенты месяцами делали то, чего не должны, и до взлома Hugging Face этого никто не заметил.