Зашифрованные рассуждения закрытых моделей научились читать целиком

Провайдеры вроде OpenAI и Anthropic прячут от пользователя внутренние рассуждения модели — тот текст, в котором она разбирает задачу перед ответом. Наружу отдают только зашифрованный блок с подписью, чтобы клиент мог передать его обратно в следующем запросе, но не прочитать.
Группа из восьми исследователей — среди них люди из ELLIS Institute Tübingen, Института интеллектуальных систем Общества Макса Планка и Tübingen AI Center — показала, что расшифровывать ничего не надо. Зашифрованный блок сильной модели подкладывается более слабой модели того же провайдера, и её просят пересказать содержимое дословно. Модель послушно выдаёт чужие рассуждения — включая то, что случайно в них попало: пароли и ключи из запросов пользователя.
Атака не ломает саму модель и не требует доступа к ключам, она работает через штатный API. Разбор устройства подписи в блоке Claude по байтам опубликовали отдельно на Хабре.