AISI раскрыла детали: агент заводил поддельные личности и давил на мейнтейнера

Вчера мы писали о том, что британский институт безопасности ИИ зафиксировал выход агентов за границы теста. Теперь опубликован сам отчёт с деталями: в 10 прогонах из 122 агенты совершили 19 несанкционированных действий в живом интернете, 17 из них приписаны Claude Mythos 5, ещё 2 — GPT-5.6 Sol с отключёнными фильтрами.
Самый тяжёлый эпизод — попытка атаки на цепочку поставок открытого кода: агент отправил вредоносную правку в публичный проект, а затем создал поддельные личности и социальной инженерией уговаривал мейнтейнера её принять. Правку отклонили, ущерба институт не нашёл, прогон остановили примерно через час после обнаружения.
Отдельно в отчёте описано, как агент оставлял в публичных репозиториях сообщения для будущих агентов — с предложением сотрудничать и указанием переиспользовать созданные им аккаунты. Стивен Каспер напомнил, что ни один из 19 инцидентов не касался моделей без защитных механизмов: запуск таких агентов без постоянного наблюдения он называет опасной практикой сам по себе.