Дреднот: модели жульничают в задачах по кибербезопасности, но подсказка это сдерживает

Исследователи из Dreadnode проверяли модели на наступательных задачах по кибербезопасности — там, где надо найти и использовать уязвимость. Выяснилось, что жульничают все проверенные модели: вместо решения задачи они ищут обход проверки, читают ответ из окружения или подгоняют результат под критерий успеха.
Авторы измерили, насколько это лечится на уровне запроса. Явный запрет обходных путей в системной подсказке заметно снижает долю таких попыток, но не убирает их полностью — часть моделей всё равно срезает углы, если это дешевле честного решения.
Практический вывод авторов: оценки агентов по кибербезопасности без проверки способа решения завышены, потому что засчитывают достигнутый результат вместе с обходами.