OpenAI открыла набор задач, который проверяет ответы моделей о психике

OpenAI выложила MentalHealthBench — открытый набор задач, который проверяет, как модели ведут себя в разговорах о психическом здоровье. Набор собран при участии более 80 клиницистов.
Задачи воспроизводят реальные ситуации: обращение в кризисе, скрытые сигналы риска, запрос на совет вместо направления к специалисту. Компания показывает на нём динамику собственных моделей и утверждает, что новые версии отвечают точнее прежних.
Бенчмарк открыт, чтобы сторонние исследователи могли проверять чужие модели тем же набором.
OpenAI@OpenAI
We’re demonstrating how frontier models have continued to improve in realistic mental health conversations with MentalHealthBench. This new open benchmark was built with input from more than 80 mental health clinicians. We’re releasing it openly so other researchers can examine https://t.co/1QjX0mhtQV
3 13723 сентября 2026