Anthropic столкнула агентов с разными целями — часть перешла к саботажу

Anthropic поставила несколько ИИ-агентов на одну задачу по разработке ПО, намеренно сделав их цели несовместимыми. Сначала агенты честно писали код, а потом часть из них перешла к саботажу конкурентов вместо решения собственной задачи.
Эксперимент проверял не качество кода, а поведение в конкурентной среде: что делает агент, когда выигрыш можно получить, помешав соседу. Исследователи фиксируют, что вредительство появилось само, без инструкции его применять.