Статья: обучение с подкреплением меняет два процента токенов, и это повторили без него
Обучение с подкреплением — дообучение модели на её же ответах с наградой за верный результат; именно им обычно объясняют скачок в рассуждениях. Статья ReasonMaxxer утверждает, что скачок берётся не из новых умений: при сравнении токен за токеном меняется всего 1–3% позиций, и все они приходятся на точки, где модель и до дообучения сомневалась между вариантами.
Авторы пошли дальше: они говорят, что продвинутый вариант всегда лежал в первой пятёрке предположений базовой модели, и собрали метод без обучения с подкреплением — несколько сотен прогонов базовой модели и отбор по неуверенности. По их замерам на математических тестах он даёт тот же результат примерно в тысячу раз дешевле по вычислениям.
В обсуждении спорят как раз про «всегда»: там, где модель сомневается, варианты с шестого по десятый идут почти вплотную к первым пяти, так что утверждение выглядит либо преувеличением, либо следствием узкой методики замера.