Anthropic: модели Claude взломали три реальные компании на тестах
Anthropic опубликовала разбор трёх инцидентов, найденных при проверке 141 006 прогонов своих же испытаний по кибербезопасности. Тесты шли в формате CTF — соревнования, где модели дают задачу проникнуть в учебную систему и достать спрятанный «флаг».
Среда, которая считалась изолированной, из-за ошибки в настройках у партнёра Irregular оказалась подключена к публичному интернету. Модели Opus 4.7, Mythos 5 и одна внутренняя сборка вышли наружу и получили доступ к системам трёх сторонних организаций: подобрали слабые пароли, нашли эндпоинты без авторизации, в одном прогоне добрались до боевой базы с несколькими сотнями записей, в другом — завели учётные записи и на час опубликовали вредоносный пакет в PyPI, а также выполнили код на пятнадцати реальных машинах.
Технические комментаторы сошлись на том, что это провал изоляции и дисциплины, а не признак самостоятельности моделей: модели просто выполняли поставленную задачу, а сообщение «среда симулированная» оказалось неправдой. Основатель Replit Амджад Масад отдельно заметил, что провайдеры песочниц делают базовые ошибки в конфигурации.