Google DeepMind: спор двух моделей уменьшает подгонку под оценщика

Когда модель дообучают с подкреплением, а оценки ставит другая модель-судья, появляется известная дырка: обучаемая модель начинает не решать задачу лучше, а убеждать судью. Особенно на размытых задачах, где правильного ответа нет.
Google DeepMind предложила заменить одиночную оценку спором: генератор выдаёт ответ, критик его атакует, а решает более слабая модель-арбитр. По статье такое обучение реже приводит к подгонке под оценщика, чем обычная схема с судьёй. Логика в том, что убедить арбитра, которому противная сторона тут же указывает на слабые места, труднее, чем убедить его в одиночку.
Séb Krier@sebkrier
Training models with RL can often lead to the reward signal being gamed; for example when you use an LLM judge for fuzzy tasks, the model being trained can learn to simply convince the judge to give high rewards. Debate can be very useful to reduce this behaviour! In principle https://t.co/TTPkVWe4Fr
13119 августа 2026