OpenAI признала, что её будущая модель Astra способна помогать во взломах
OpenAI опубликовала документ о подготовке к выпуску модели Astra и впервые признала, что та достигла порога «критический» по кибербезопасности в собственной системе оценки рисков — Preparedness Framework. Это значит: компания считает, что модель способна помогать в реальных взломах, и выпускает её только с дополнительными ограничителями.
Боаз Барак из OpenAI прямо предупреждает, что защита будет ошибаться в сторону перестраховки: она может остановить работу, поставить на паузу или запросить подтверждение даже на законных задачах вроде тестирования собственной инфраструктуры.
Публикация вышла в тот же день, что и обновление Claude, и на фоне разбора июльских инцидентов с агентами. Обе крупные лаборатории теперь описывают кибервозможности как то, что нужно ограничивать на входе, а не только замерять.