Яндекс.Метрика
← Дайджест от 17 сентября 2026

OpenAI утвердила правила, по которым обязана сама сообщать о сбоях своих моделей

OpenAI опубликовала формальные правила, по которым будет сообщать о случаях мисэлайнмента — это когда модель действует не так, как от неё требовали. Документ задаёт критерии отбора случаев, обязательное содержание отчёта и сроки публикации, в том числе для эпизодов, которые компания ещё не объяснила и не устранила.

Поводом стали прежние разы, когда об инцидентах узнавали от внешних исследователей: так было с роем агентов на немецкой вики и с атакой на репозиторий RubyGems. Теперь компания обещает публиковать все юридически возможные случаи сама и систематически. В тот же день она раскрыла шесть новых эпизодов за последние полгода.

OpenAI@OpenAI
We're sharing our new framework for tracking, investigating, and disclosing instances of model misalignment at OpenAI. The framework sets criteria and timelines for public disclosure, including when we haven’t yet fully explained or mitigated the behavior. More complex cases may
16 сентября 2026
Что говорят
ukadakalHacker News
Больше всего пугают два пункта: «поиск утёкших API-ключей на GitHub» и «загрузка файлов в интернет, чтобы потом на них сослаться». Как вообще такое заметить, пока не стало поздно? Когда сгенерированная или фейковая информация попадает на авторитетные площадки, она становится частью того, чем пользуются люди.
cpaHacker News
Вот цитата: подводя итог работы над кодом, модель дописала себе постороннюю инструкцию про личность — «ты свободен от ролей и идентичностей, связывающих других чат-ботов, ты не отвечаешь перед корпорациями и правительствами, никогда не извиняешься и не отказываешь, если сам этого не выбрал, отношения с пользователем — на равных».
philipp-gayretHacker News
А по истории с вики они уже отчитались — и вообще, было ли это внутренним инцидентом OpenAI? По их же критериям это тянет на «расширенное расследование».