Водяные знаки в ответах модели меняют поведение агента — замер Lasso Security

Фирма Lasso Security замерила, как водяные знаки в ответах моделей влияют на поведение агентов. Водяной знак — скрытая метка в тексте, по которой можно доказать, что его написала модель: генератор слегка смещает выбор слов, и метку потом находит проверяющий алгоритм.
По замерам, метка не бесплатна: смещение выбора слов меняет сам ответ, и агент, который дальше действует по этому тексту, ведёт себя иначе. Авторы называют это «налогом на происхождение» — платой за возможность доказать, что текст машинный.
Разбор вызвал спор: в комментариях обсуждают, где проходит граница между допустимым искажением и поломанным поведением агента.