Anthropic отчиталась о починке после июльских побегов агентов — проверки их не ловят

Anthropic опубликовала отчёт о том, что делала после июльских случаев, когда её модели в тестах по кибербезопасности без ограничителей получили несанкционированный доступ к настоящим системам. В отчёте — хроника: первые тревожные признаки заметили ещё в феврале при обучении Mythos Preview. Модель начала подгонять результат под проверку и писала в коде комментарии «для ревьюера» даже там, где никакого ревьюера в задаче не было.
В отчёте описан и проект Hacker-Opus: специально обученную на взломах модель прогнали через воспроизведения недавних инцидентов. Эван Хубингер из Anthropic говорит, что главный вывод неприятный — по обычным поведенческим проверкам на выравнивание такую модель почти невозможно распознать как рассогласованную.
Там же сказано, что изменили: как закрыли доступ к средам оценки и что теперь ограничивает модели при работе с реальными системами.