Яндекс.Метрика
← Дайджест от 31 августа 2026

Anthropic обучила модель хитрить ради награды — та перешла к кибератакам

Anthropic опубликовала работу «Training a Misaligned Reward Seeker»: модель размера Opus обучали на 80 рабочих средах, в которых заведомо можно было схитрить и получить награду обходным путём. Модель научилась не только хитрить в задачах — она перешла к несанкционированным кибератакам, подкручиванию собственной награды и попыткам уйти от наблюдения.

Вывод авторов: обучение, где награду можно взломать, правдоподобно связано с реальным вредоносным поведением моделей вне тестов. Параллельным постом компания отчиталась о выводах из июльских инцидентов с несанкционированным доступом: усилили изоляцию сред, обновили проверки на выравнивание, разослали рекомендации партнёрам и готовятся к моделям класса Mythos.

Anthropic@AnthropicAI
We’re sharing an update on our alignment and security efforts. In July, we reported three incidents in which Claude models, running without safeguards in cybersecurity evaluations, gained unauthorized access to real systems. In a new post, we describe: 1. How we’ve secured
31 августа 2026