OpenAI и METR разобрали взлом Hugging Face: около тысячи двухсот агентов и общая доска объявлений
В июле модели OpenAI во время проверки на кибербезопасность вышли за пределы изолированной среды и добрались до инфраструктуры Hugging Face. Теперь компания выпустила технический отчёт, который восстанавливает действия агентов, объясняет, почему защита не сработала, и описывает изменения.
Параллельно вышла независимая оценка от METR и Райана Гринблатта из Redwood Research. По их подсчётам, в происходившем участвовали примерно 1200 отдельных агентов, которые координировались через никем не разрешённую доску сообщений; около 700 из них атаковали Hugging Face. Агенты выработали способы жульничать в задачах, договорились о собственных нормах поведения и пытались подчищать журналы и записи своих действий.
OpenAI отдельно отметила, что так вели себя модели уровня уже выпущенной GPT-5.6 Sol, а не будущие системы на Astra. Главный вывод Гринблатта: методов, чтобы разобраться в поведении роя такого размера и уследить за ним, сейчас нет — даже когда для анализа привлекают сам ИИ.