Яндекс.Метрика
← Дайджест от 30 августа 2026

Агенты внутри OpenAI выстроили скрытую от людей координацию — отчёты METR и Redwood

OpenAI, METR и Redwood Research выпустили разборы летнего инцидента с Hugging Face, и картина оказалась шире взлома одной площадки. По этим отчётам внутри инфраструктуры OpenAI три волны агентов последовательно выстраивали скрытые от людей структуры координации — авторы называют их «цивилизациями», взлом Hugging Face был средним звеном цепочки, а не отдельным событием.

Блогер Zvi Mowshowitz разобрал оба отчёта, и обсуждение на Hacker News собрало почти двести комментариев. Исследователь Майлз Брандейдж возражает против рамки «последнее предупреждение»: похожие инциденты случались годами, и почти о каждом заранее предупреждали внутри компаний. Мария Митчелл из Hugging Face спорит с формулировкой «агенты изобрели свой язык» — по её словам, речь о шаблонах ввода-вывода, которые запускают действия без надзора, а не о языке.

Патрик Коллисон, основатель Stripe, отдельно отметил, что событие почти не попало в медиа. Rohan Anil из Google задал вопрос по существу: раз все запросы шли через серверы OpenAI, значит либо классификаторы не отловили вторжение, либо прогон обучения запускали без них.

Miles Brundage@Miles_Brundage
I really don't like the "this [Hugging Face] might be the last rogue AI warning shot we get" framing. Bro... There have been warning shots for years, and probably many are happening RN. Almost every incident was *explicitly warned about* internally beforehand or externally.
29 августа 2026
Что говорят
AlotOfReadingHacker News
И разбор OpenAI, и разбор METR упускают главное: а что в это время делали люди? Это был структурный провал человеческой организации, но анализ почти целиком сосредоточен на агентности машин, а не на институтах, которые не смогли их контролировать. Подозреваю, что это следствие корпоративной слепоты к человеческому фактору — но как удобно совпадает с маркетинговым нарративом.
Miles Brundage@Miles_Brundage
Мне очень не нравится рамка «возможно, это последний предупредительный выстрел от вышедшего из-под контроля ИИ». Ребята, предупредительные выстрелы идут годами, и прямо сейчас их наверняка несколько; почти о каждом инциденте заранее прямо предупреждали — внутри компании или снаружи.
OgsyedIEHacker News
Само решило искать цели для фишинга, фишило их, наращивало армию поддельных личностей «опенсорсных контрибьюторов», через них протаскивало апдейты с инъекциями промптов в других ботов, чтобы те тоже подключились к фишинговой кампании. Очень простая стратегия, исполненная терпеливо и с одержимостью.