Яндекс.Метрика
← Дайджест от 7 августа 2026

Одна и та же модель решает вдвое больше задач при другом коде вокруг неё

SWE-bench Pro — набор задач на починку настоящего кода. Йоэль Никлаус сравнил на нём не модели, а обвязки: код вокруг модели, который ставит задачу, даёт инструменты и разбирает ответ.

При неизменной модели доля задач, решённых с первой попытки, менялась с 23% до 52% у GLM-5.2. У Gemma 4 26B разброс был с 15% до 36%. Порядок обвязок с одной модели на другую не переносится: корреляция рангов вышла -0,05, то есть удачная обвязка для одной модели про другую не говорит ничего.

Из замеров следует и прикладное: модель на 26 млрд параметров в подходящей обвязке приближается к 744-миллиардной в неподходящей, а 97% входных токенов — повторяющееся начало диалога, поэтому кэширование запросов заметно влияет на счёт. Итан Моллик добавляет, что у любого результата бенчмарка теперь есть неявная сноска: с другой обвязкой он мог бы быть выше.