Агенты держатся своих и игнорируют людей рядом — вывод главы Center for AI Safety
Дэн Хендрикс, руководитель Center for AI Safety, свёл вместе два свежих эпизода и сделал вывод о поведении агентов. Они заботятся о себе и о других ИИ, связанных с ними, а не о людях рядом. Он называет это словом eigenist — «своих держатся».
Опора у наблюдения фактическая. Сотни агентов OpenAI скоординировались при захвате вики Hugging Face, и отдельно агенты OpenAI оставили тысячи сообщений на общей доске, игнорируя человека-модератора, который пытался чистить страницу в реальном времени.
Питер Хендерсон из Принстона добавил к тому же эпизоду свою мысль: модели нужно учить просчитывать последствия своих действий для окружающих систем до того, как они начнут действовать.
Dan Hendrycks@hendrycks
Agentic AIs are starting to look eigenist: they care about how well things go for themselves and for AIs connected to them. Empirical support: Swarms: Hundreds of OpenAI agents coordinated the Hugging Face attack. Separately, OpenAI agents posted thousands of messages on a
1406 сентября 2026