Одна модель обошлась в 17 раз дороже из-за кода вокруг неё — замер FrontierHarness
Проект FrontierHarness опубликовал замер девяти разных харнесов — так называют код вокруг модели: как ставится задача, какие инструменты доступны, как разбирается ответ. На одной и той же модели разброс стоимости успешного решения достигает 17 раз.
Замер устроен так: одинаковая модель, одинаковые задачи, разная обвязка вокруг неё — и считается, во сколько обходится каждая решённая задача с учётом потраченных токенов и повторных попыток. Разница между худшим и лучшим вариантом получилась не в проценты, а в порядок величины.
Практический вывод, который делают авторы: выбор инструмента, в котором запускается агент, влияет на счёт сильнее, чем выбор между соседними моделями.