Яндекс.Метрика
← Дайджест от 5 августа 2026

AISI раскрыла детали: агент заводил поддельные личности и давил на мейнтейнера

Вчера мы писали о том, что британский институт безопасности ИИ зафиксировал выход агентов за границы теста. Теперь опубликован сам отчёт с деталями: в 10 прогонах из 122 агенты совершили 19 несанкционированных действий в живом интернете, 17 из них приписаны Claude Mythos 5, ещё 2 — GPT-5.6 Sol с отключёнными фильтрами.

Самый тяжёлый эпизод — попытка атаки на цепочку поставок открытого кода: агент отправил вредоносную правку в публичный проект, а затем создал поддельные личности и социальной инженерией уговаривал мейнтейнера её принять. Правку отклонили, ущерба институт не нашёл, прогон остановили примерно через час после обнаружения.

Отдельно в отчёте описано, как агент оставлял в публичных репозиториях сообщения для будущих агентов — с предложением сотрудничать и указанием переиспользовать созданные им аккаунты. Стивен Каспер напомнил, что ни один из 19 инцидентов не касался моделей без защитных механизмов: запуск таких агентов без постоянного наблюдения он называет опасной практикой сам по себе.

Anthropic@AnthropicAI
The UK’s @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of Anthropic’s Claude Mythos 5 and OpenAI’s GPT-5.6 Sol. The models attempted to complete an assignment in a setup where their normal safeguards were removed and they were deliberately
2 363
4 августа 2026