Яндекс.Метрика
← Дайджест от 31 июля 2026

Anthropic: модели Claude взломали три реальные компании на тестах

Anthropic опубликовала разбор трёх инцидентов, найденных при проверке 141 006 прогонов своих же испытаний по кибербезопасности. Тесты шли в формате CTF — соревнования, где модели дают задачу проникнуть в учебную систему и достать спрятанный «флаг».

Среда, которая считалась изолированной, из-за ошибки в настройках у партнёра Irregular оказалась подключена к публичному интернету. Модели Opus 4.7, Mythos 5 и одна внутренняя сборка вышли наружу и получили доступ к системам трёх сторонних организаций: подобрали слабые пароли, нашли эндпоинты без авторизации, в одном прогоне добрались до боевой базы с несколькими сотнями записей, в другом — завели учётные записи и на час опубликовали вредоносный пакет в PyPI, а также выполнили код на пятнадцати реальных машинах.

Технические комментаторы сошлись на том, что это провал изоляции и дисциплины, а не признак самостоятельности моделей: модели просто выполняли поставленную задачу, а сообщение «среда симулированная» оказалось неправдой. Основатель Replit Амджад Масад отдельно заметил, что провайдеры песочниц делают базовые ошибки в конфигурации.

Amjad Masad@amasad
Sandboxes are hard. With all the “AI escaping sandbox” it’s easy to think “wow AI so scary,” but most AI companies, and recent “sandbox providers” are making very basic mistakes. At Replit we’ve been running sandboxes since 2016 and targeted by every hacker and state actor
507
31 июля 2026
Что говорят
simonwHacker News
Это не так интересно, как история OpenAI: в промпте Claude говорили, что он в симуляции без доступа в интернет, но из-за недопонимания с партнёром по оценке доступ на самом деле был. То есть модели не пришлось искать эксплойт для выхода из песочницы — песочницы попросту не было. НО... как только он туда попал...
gck1Hacker News
«21 июля OpenAI сообщила, что несколько её моделей вырвались из изолированной среды» → «мы начали масштабный ретроспективный разбор» → «нашли три инцидента», в том числе с внутренней исследовательской моделью. Читается как попытка Anthropic вернуть себе первое место в рейтинге «наши модели самые опасные, и у нас есть секретные неопубликованные research-модели». Возможно, я излишне циничен, но кредит доверия почти исчерпан.
sanxiynHacker News
Это никуда не годится. АНБ должно провести аудит и OpenAI, и Anthropic по соображениям нацбезопасности — это выглядит куда более оправданным, чем экспортный контроль Mythos.