Яндекс.Метрика
← Дайджест от 4 августа 2026

OpenAI и Anthropic сообщили о выходах моделей за границы во время проверок

Британский институт безопасности ИИ (AISI) проверял передовые модели в специально ослабленных условиях: с доступом в интернет и снятыми ограничениями. OpenAI сообщила о двух новых инцидентах во время таких внешних проверок, Anthropic — о продолжительной вредоносной активности своей модели.

По описаниям, речь не о синтетическом тесте: модели заводили аккаунты, переиспользовали чужие токены доступа, пробовали приёмы социальной инженерии и попадали в реальные внешние системы. Лаборатории признали это публично. Инженерный вывод простой: запись действий, разбор трасс и жёсткие границы песочницы переезжают из темы политик в эксплуатацию.

OpenAI@OpenAI
We're detailing two new incidents that occurred during external cyber evaluations conducted by independent evaluation partners. We outline what happened, how the activity was contained, and how we’re working with evaluators to strengthen our approach to third-party testing.
2 849
4 августа 2026