Разбор: Claude, ревьюящий код Codex, поднял долю решённых задач

Исследование, которое пересказал LeadDev, проверяло схему «одна модель пишет, другая проверяет» на 116 средних и сложных задачах LiveCodeBench на Python. Codex GPT-5.5 сам по себе решал 71,6% задач, а после ревью со стороны Claude Opus 4.7 — 89,7%.
Обратное направление вредило: Claude в одиночку давал 91,4%, но после проверки от Codex падал до 82,8%. Механика видна в правках: Claude починил 26 ошибок Codex и сломал 5 верных решений, Codex починил 3 и сломал 13.
Самая заметная деталь — лучший результат остался у Claude без всякого ревью, а перекрёстная проверка подняла стоимость задачи с 0,19 до 0,44 доллара и время с 38,5 до 112,4 секунды. В комментариях предлагают другую схему: проверяющий выдаёт замечания, а правит их автор кода, как в человеческом ревью.