Две попытки дешёвой модели решили больше задач, чем одна дорогая за те же деньги

Together AI, хостинг чужих моделей, сравнила, как далеко уезжает один и тот же бюджет на бенчмарке DeepSWE — наборе задач по правке реального кода. Сравнивали дешёвую DeepSeek V4 Flash и дорогую GPT-5.6 Luna.
Вышло, что две попытки DeepSeek V4 Flash решают больше задач, чем одна попытка Luna, и обходятся примерно втрое дешевле. Смысл простой: когда модель ошибается, повторный запуск иногда даёт верный ответ, и на дешёвой модели повторов можно позволить себе больше.
Ограничение у метода тоже есть: чтобы выбрать из двух попыток правильную, нужен способ проверки — на задачах с кодом это тесты, а там, где проверить нечем, схема не работает.
Together AI@togethercompute
We compared how far the same budget goes with DeepSeek V4 Flash and GPT-5.6 Luna on DeepSWE. Two DeepSeek V4 Flash attempts solved MORE tasks than one Luna attempt at roughly one-third the cost. https://t.co/yzLS3E3v9E
2219 августа 2026