Яндекс.Метрика
← Дайджест от 18 августа 2026

Проверка агента поддержки по тексту диалога дала 18 из 20, по вызовам инструментов — 8

Команда строила оценку для ИИ-агента поддержки: у него было десять метрик и ни одного ответа на главный вопрос — какую долю обращений он реально закрывает. Сделали модель-судью, которая читает диалог и ставит вердикт.

Разрыв оказался в том, что судья читал. Судья, видевший только текст переписки, поставил 18 из 20; проверка по реальным вызовам инструментов на тех же диалогах дала 8 из 20. Текстовая оценка считала правдоподобный ответ верным и не могла отличить выполненное действие от рассказа о нём. Формулу вердикта после этого переделывали дважды.