Шесть моделей-судей из четырёх лабораторий дают меньше двух независимых голосов
Автор на Хабре проверял идею, которая считается рабочей: если ответ модели оценивают шесть разных моделей-судей и голосуют, консенсус точнее любого одиночного судьи. На наборе RAGTruth это по-прежнему подтверждается.
Но он замерил другое — насколько независимы сами голоса. Средняя корреляция ошибок между судьями оказалась около 0,42, и в пересчёте шесть судей из четырёх лабораторий и трёх стран дают эффективно 1,9 независимого голоса. То есть судьи ошибаются в одних и тех же местах, и добавление ещё одного из другой лаборатории почти не расширяет обзор.