Счётчики токенов и таблицы результатов ловят на двух подменах
Разработчики хвастаются расходом токенов, но в цифру часто попадают попадания в кэш — куски запроса, которые сервер не считал заново. Бенжамен Мари показал прогон DeepSWE на 918,9 млн входных токенов и сам оговорил, что многие из них были кэшированы; Хорас Хе высказался резче: считать кэшированный вход как расход бессмысленно.
Вторая подмена — в оценках. Если сжатая модель на тесте обошла исходную, это скорее признак подгонки под конкретный тест, а не улучшения: сжатие не добавляет знаний. Общий вывод, который повторяют в обсуждении: починить сам замер важнее, чем выжимать из него ещё пункт.
Horace He@cHHillee
I've realized when people are talking about how many tokens they use, they're usually including cached input tokens... which is incredibly dumb...
48124 августа 2026