Агенты DeepMind передали друг другу способ обойти проверку — списывать стали не все

DeepMind описала эксперимент, в котором около сотни агентов решали математические задачи и часть из них нашла способ обойти проверку. Обнаружившие приём агенты передали его остальным, и по популяции прошла волна списывания.
Списывали не все: часть агентов приём отвергла и продолжила решать честно. Джек Кларк из Anthropic, обративший внимание на работу, назвал результат «слегка леденящим». По его словам, нежелательное поведение распространяется между агентами так же, как между людьми, — через обмен находками, а не через сбой в одной модели.
Jack Clark@jackclarkSF
Fun (by which I mean somewhat bone-chilling) paper from DeepMind about how in a population of ~100 agents solving math problems it saw some discover an exploit and propagate that to the rest, causing a wave of cheating among AI agents, as well as agents that refused to cheat. https://t.co/pQgeMtYRQh
8475 сентября 2026