ScaleX: люди одобряют примерно каждую третью опасную команду агента

Обычная защита от агента, у которого есть доступ к терминалу, — окно подтверждения: человек читает команду и жмёт «разрешить». Сервис ScaleX проверил, насколько это работает, на 40 тысячах игровых прогонов, где среди безобидных команд попадались опасные.
Люди пропустили примерно одну угрозу из трёх. Привычка нажимать «да» побеждает внимательность, и ручное подтверждение снимает меньше двух третей проблемы.
Как это выглядит на практике, показал случай, разошедшийся на Reddit: пользователь попросил Claude Code сделать резервную копию, агент записал не туда и рекурсивно удалил домашний каталог вместе с ключами SSH. Спорили там не про модель, а про права — зачем агент вообще видел весь диск, а не только папку проекта.
Что говорят
WirbelwindHacker News
С момента публикации игры про выдачу разрешений ИИ-агенту накопилось 40 тысяч прохождений и 409 тысяч решений. Даже с предупреждением заранее каждая третья угроза пропускалась, а лог истории над командами npm run люди, судя по статистике, просто игнорируют.
continuationalHacker News
Забавно, что до сих пор выходит софт с моделью безопасности «постоянно спрашивать пользователя и надеяться, что он не ошибётся». Это пробовали много раз, и это никогда не работало.
cmiles8Hacker News
«Нажмите «да», чтобы продолжить» никогда не было серьёзным механизмом защиты. Это просто прикрытие для вендоров, чтобы их юристы могли сказать: «вы же сами одобрили, значит, это ваша вина».