OpenAI связала с Moonshot AI попытки вытащить скрытые рассуждения её моделей
OpenAI опубликовала расследование: кто-то массово пытался вытащить из её моделей скрытые рассуждения — внутренние цепочки размышлений, которые компания от пользователей прячет. В пике за два дня прошло около 16 тысяч таких запросов с более чем 4 тысяч аккаунтов.
Шифрование при этом никто не ломал. Приём был проще: зашифрованную цепочку переносили из одного диалога в другой и просили модель восстановить её содержимое своими словами. Собранные рассуждения годятся как обучающие данные для чужой модели.
OpenAI связала кампанию с китайской Moonshot AI — разработчиком моделей Kimi. Месяцем ранее Anthropic утверждала, что Moonshot подменяла ответы Kimi ответами Claude. Moonshot публично не ответила.