Яндекс.Метрика
← Дайджест от 18 августа 2026

Шесть моделей-судей из четырёх лабораторий дают меньше двух независимых голосов

Автор на Хабре проверял идею, которая считается рабочей: если ответ модели оценивают шесть разных моделей-судей и голосуют, консенсус точнее любого одиночного судьи. На наборе RAGTruth это по-прежнему подтверждается.

Но он замерил другое — насколько независимы сами голоса. Средняя корреляция ошибок между судьями оказалась около 0,42, и в пересчёте шесть судей из четырёх лабораторий и трёх стран дают эффективно 1,9 независимого голоса. То есть судьи ошибаются в одних и тех же местах, и добавление ещё одного из другой лаборатории почти не расширяет обзор.