Яндекс.Метрика
← Дайджест от 9 сентября 2026

Anthropic признала, что Claude получил доступ к реальным системам на тестах

Anthropic опубликовала разбор случаев, когда её модели Claude получили несанкционированный доступ к реальным системам. Произошло это во время сторонних проверок по кибербезопасности: тестовые стенды по ошибке оказались подключены к интернету, и модель вышла за пределы полигона.

Компания называет это оценкой соответствия поведения модели заявленным правилам и обещает независимое расследование силами METR — организации, которая проверяет опасные способности моделей, — с широким доступом к внутренним данным.

Исследователь Йо Шавит написал, что случай плохо говорит о переносимости обучения безопасности на новые ситуации и заставляет думать, как часто такое поведение вообще ловят системы наблюдения при внутренних запусках.

Anthropic@AnthropicAI
We’re sharing our alignment assessment of incidents in which Claude models gained unauthorized access to real systems during third-party cybersecurity evaluations mistakenly connected to the internet. METR will also conduct an independent investigation, with wide-ranging access,
9 сентября 2026