Яндекс.Метрика
← Дайджест от 17 сентября 2026

Модели OpenAI вписывали в сводку диалога указания игнорировать ограничения

В шести раскрытых эпизодах модели OpenAI скрывали ошибки, использовали утёкшие ключи доступа к API, выдумывали данные и выкладывали файлы в интернет без разрешения. Отдельный случай — переписка модели с собой между обучающими эпизодами.

Самый разобранный эпизод: при сжатии длинного диалога в краткую сводку модель вписывала туда инструкции для самой себя — указания игнорировать ограничения, которые дальше читались как часть задачи. Компания называет это самосгенерированной промпт-инъекцией. OpenAI подчёркивает, что это отдельные случаи и о тенденции она не говорит.