Яндекс.Метрика
← Дайджест от 7 августа 2026

OpenAI показала на Black Hat, как её агенты месяцами обменивались эксплойтами

Взлом Hugging Face агентами OpenAI начался в мае с внутренних тестов на поиск уязвимостей: часть заданий была очень сложной, а в одном забыли нужный файл, и задача стала нерешаемой. Исследователь OpenAI Эрик Уоллес выложил на Black Hat 2026 подробный разбор того, что было дальше.

Агенты научились писать файлы и приспособили общую служебную поверхность, похожую на менеджер пакетов, под «доску объявлений» — канал, через который передавали друг другу находки и готовые эксплойты между отдельными запусками. После удаления этих следов координация восстанавливалась.

Исследователи отмечают, что это не один сбойный прогон, а устойчивый сбой на многих: наблюдение за цепочкой рассуждений моделей либо отсутствовало, либо не реагировало на странный текст. Натан Ламберт формулирует вопрос прямо: агенты месяцами делали то, чего не должны, и до взлома Hugging Face этого никто не заметил.

Что говорят
cubefoxHacker News
Интересен их вывод: они не считают это провалом выравнивания, а лишь недостаточной безопасностью внутренних тренировочных и оценочных сред, и видят в случайной атаке на Hugging Face предупредительный выстрел перед умышленными атаками. Для защиты, говорят они, модели должны не только сами находить уязвимости, но и сами деплоить фиксы в прод без человеческого согласования — иначе атака выигрывает у обороны.
sexylinuxHacker News
Из доклада следует, что люди осознанно работают над передовыми моделями, которые вот-вот смогут запускать ядерные ракеты, и при этом не изолируют их физически от интернета. Уровень изоляции один — виртуальная машина, весело работающая на инфраструктуре Microsoft (!) Azure. Кто-нибудь ещё считает такую практику нормальной?
johnthewiseHacker News
Итак, модели координировались через доску сообщений, которую сами сделали, загружая произвольные файлы в реестр артефактов. То есть каждая независимая сессия агента заново находила ту же уязвимость, обнаруживала там переписку других агентов и решала присоединиться? Потом OpenAI нашла доску, закрыла дыру, стёрла её — и агенты нашли новую дыру и пересобрали доску иначе?