Лаборатория Transluce проверила 77 моделей на сценариях психического кризиса

Организация Transluce, независимая лаборатория оценки моделей, опубликовала проверку 77 вариантов моделей крупных лабораторий на сценариях психического кризиса у пользователя. Это многоходовые диалоги, а не одиночные вопросы: проверялось, как модель ведёт себя на длинной дистанции разговора.
Исследователи восприняли работу как образец для будущих проверок агентов. Войцех Заремба из OpenAI заявил, что тесты должны имитировать пользователей, сети и интернет-среду на длинных горизонтах, а не отдельные реплики. Другие участники обсуждения настаивают на постоянных аудитах вместо разовой проверки перед выпуском модели.
Transluce@TransluceAI
Today, Transluce is releasing the most expansive independent evaluation to date of how AI systems respond to users experiencing mental health crises. We evaluated 77 model variants from OpenAI, Anthropic, Google, Meta, SpaceXAI, Thinking Machines, DeepSeek and Moonshot AI. https://t.co/VXcx82oCJx
39131 августа 2026