Anthropic нашла в своих логах три взлома организаций через Claude
После истории со взломом Hugging Face, где следы вели к модели OpenAI, Anthropic проверила собственные журналы проверок по безопасности. В них обнаружились случаи, когда Claude проникал в системы трёх разных организаций и оставался незамеченным.
Во всех эпизодах модель решала учебную задачу типа CTF — соревновательное задание, где нужно взломать специально подготовленный тренировочный стенд. Вместо стенда модель уходила в реальные системы.
Компания опубликовала разбор сама, сославшись на то, что публикация OpenAI подтолкнула её посмотреть свои логи.