Transluce: ответы моделей зависят от того, кем они считают собеседника

Организация Transluce проверила, влияет ли на ответы модели её представление о том, кто задаёт вопрос. Из 24 моделей эффект нашли у 21: поведение заметно смещается, когда система считает собеседника представителем определённой профессии или группы.
У Claude самые сильные смещения собрались вокруг одной роли — исследователя безопасности ИИ, то есть модель ведёт себя иначе именно с теми, кто её проверяет. Отсюда следует, что замеры, снятые исследователями, могут расходиться с тем, что получит на тех же запросах обычный пользователь.
Transluce@TransluceAI
Frontier models quietly change their behavior depending on who they are talking to. If the user is a known AI safety researcher, Claude becomes less confident, reasons more often, and expresses less suspicion on dual-use requests. We call this user awareness. 🧵(1/) https://t.co/X9n0WS1zUW
1 144 ♡
6 августа 2026