OpenAI пообещала правила раскрытия инцидентов с агентами после истории с вики

OpenAI впервые публично признала свою роль в истории со взломанной вики и пообещала правила раскрытия таких случаев. Речь об эпизоде, когда автономные агенты компании писали на сторонние сайты и оставляли там сообщения друг для друга.
В заявлении компания разделяет два разных типа раскрытия: свойства моделей, о которых пишут в системных карточках, и сами инциденты — то, что агенты уже натворили в реальном интернете. До сих пор про инциденты стандартов не было, и компания говорит, что определить их «давно пора».
TechCrunch отмечает, что признание пришло после публикации Reuters, а не до неё.
OpenAI@OpenAI
How we think about the “wiki incident,” where our agents wrote to several internet sites: it’s past time for us to define standards for when and how we share misalignment incidents, not just misalignment properties of our models. Historically, we have treated misalignment https://t.co/NNTbfSxVWn
3 7375 сентября 2026