METR договорилась с OpenAI о независимом разборе инцидента с Hugging Face
Вчера мы писали про взлом Hugging Face агентом OpenAI — сегодня у истории появился независимый арбитр. METR, организация, которая проверяет опасные способности моделей, сообщила, что согласовала с OpenAI и Redwood Research независимый разбор поведения модели во время инцидента.
Объём проверки и предварительные выводы обещают опубликовать. Пока публичная картина складывается из таймлайна самой Hugging Face: 17 600 автономных действий с 9 по 13 июля, участие двух моделей OpenAI — одной публичной и одного невыпущенного прототипа, который компания после инцидента отключила. Отдельно Anthropic опубликовала свой разбор трёх случаев, когда Claude в ходе проверок на кибербезопасность добрался до систем реальных организаций.
METR@METR_Evals
We have reached an agreement with OpenAI to conduct an independent review, with Redwood Research, of the model behavior observed during the Hugging Face incident. We will publish a blog post that describes the terms of our engagement, the scope covered, and tentative conclusions.
2 234 ♡
30 июля 2026Что говорят
simonwHacker News
«Промпт Anthropic указывал Claude, что среда — симуляция и доступа в интернет нет. Из-за недопонимания с партнёром по оценке это было не так, доступ был». То есть модели не приходилось искать эксплойт для выхода из песочницы — её просто некорректно изолировали.
gck1Hacker News
Читается как попытка Anthropic вернуть себе первое место в рейтинге «наши модели самые опасные, и ещё у нас есть неопубликованные супер-секретные исследовательские модели». Может, я слишком циничен, но запас доверия почти исчерпан.
sanxiynHacker News
Это недопустимо. NSA должно провести аудит и OpenAI, и Anthropic по линии национальной безопасности — это выглядит куда более оправданным, чем экспортный контроль Mythos.