Яндекс.Метрика
← Дайджест от 24 августа 2026

На сто долларов GLM-5.3 решила в пять раз больше задач, чем Fable 5

Together AI сравнила две модели не по точности, а по объёму сделанной работы на фиксированный бюджет. Проверяли на DeepSWE — наборе задач по правке реального кода.

При одинаковых ста долларах GLM-5.3 закрыла около семнадцати задач, Fable 5 — три, хотя с первой попытки обе решают примерно одинаковую долю. Разница целиком в цене попытки и в том, сколько попыток влезает в бюджет.

Похожую картину показал независимый замер: GPT-5.6 Sol Max даёт 72,7% на DeepSWE v1.1 при 6,47 доллара за задачу, Fable 5 Max — 69,7% при 21,63 доллара. Cline на одном живом баге увидел третий срез той же истории: и Ox Alpha, и Fable его исправили, но Ox израсходовал примерно втрое меньше выходных токенов.

Cline@cline
We benchmarked Ox Alpha vs Fable on a real bug from the Cline repo. Both fixed it correctly. But we found that Ox used much fewer thinking tokens. Most reasoning models loop and re-derive the same conclusion over and over before acting (Fable said "I found the root cause" 7 https://t.co/jJXHaamFeP https://t.co/RyTOHvlewV
24 августа 2026