Хабр сравнил семь нейросетей вслепую — по сумме баллов победила Fable 5.1
Хабр провёл слепое сравнение семи нейросетей на восьми заданиях: оценщики не знали, чей ответ читают. По сумме баллов победила Fable 5.1, но больше всего отдельных заданий взяла Kimi K3.
Расхождение показательное: модель может выигрывать по среднему качеству, уступая по числу первых мест, — сильные ответы на части заданий не всегда компенсируются ровным уровнем на остальных. Слепой формат снимает эффект узнавания стиля, из-за которого открытые сравнения часто смещены в пользу известных имён.