Яндекс.Метрика
← Дайджест от 2 сентября 2026

Qwen возглавила рейтинг Code Arena с отрывом меньше статистической погрешности

Автор на Хабре обратил внимание, что первое место Qwen3.8-Max-0902 в рейтинге Code Arena WebDev держится на пересекающихся доверительных интервалах. Модель набрала 1691 очко и опередила Claude Opus 5 Max на три пункта.

Проблема в том, что результат Qwen помечен как предварительный: голосов у неё в несколько раз меньше, чем у соперников, и погрешность заметно шире трёх пунктов. При таком разбросе разница между первым и вторым местом статистически неотличима от нуля.

Это не претензия к модели, а к чтению таблицы: строка «первое место» в арене с живым голосованием не равна «модель лучше», пока не набрана сопоставимая выборка.

Arena.ai@arena
Before Qwen3.8-Max-0902 landed in Arena yesterday, we met Qwen3.8-27B earlier this month. While in SF last week, @petergostev shared his technical assessment of this smaller open-source model from @Alibaba_Qwen. Find the full video covering Qwen3.8-27B below. https://t.co/to2KO2t6tb
2 сентября 2026