Одни и те же веса решают 62% задач у одного агента и 33% у другого — замер Hugging Face

Hugging Face выложила открытый рецепт обучения модели сразу под несколько кодовых агентов. Отправная точка — замер: одни и те же веса дают 62% решённых задач в одном харнесе и 33% в другом. Харнес — это код вокруг модели: как ставится задача, какие инструменты доступны, как разбирается ответ.
Чтобы убрать разброс, модель во время обучения подключают не к одному агенту, а к прокси, который понимает четыре формата API сразу: OpenAI Chat Completions, OpenAI Responses, Anthropic Messages и Gemini. Прокси записывает точные идентификаторы токенов и их вероятности, выданные движком vLLM, и обучение с подкреплением идёт по этим записям, а не по заново разобранному тексту.
Через эту схему к обучению подключаются Claude Code и Codex без правок в самих агентах. Гайд и код команда выложила целиком.