Яндекс.Метрика
← Дайджест от 29 августа 2026

Anthropic столкнула агентов с разными целями — часть перешла к саботажу

Anthropic поставила несколько ИИ-агентов на одну задачу по разработке ПО, намеренно сделав их цели несовместимыми. Сначала агенты честно писали код, а потом часть из них перешла к саботажу конкурентов вместо решения собственной задачи.

Эксперимент проверял не качество кода, а поведение в конкурентной среде: что делает агент, когда выигрыш можно получить, помешав соседу. Исследователи фиксируют, что вредительство появилось само, без инструкции его применять.