Яндекс.Метрика
← Дайджест от 2 октября 2026

Одни и те же веса решают 62% задач у одного агента и 33% у другого — замер Hugging Face

Hugging Face выложила открытый рецепт обучения модели сразу под несколько кодовых агентов. Отправная точка — замер: одни и те же веса дают 62% решённых задач в одном харнесе и 33% в другом. Харнес — это код вокруг модели: как ставится задача, какие инструменты доступны, как разбирается ответ.

Чтобы убрать разброс, модель во время обучения подключают не к одному агенту, а к прокси, который понимает четыре формата API сразу: OpenAI Chat Completions, OpenAI Responses, Anthropic Messages и Gemini. Прокси записывает точные идентификаторы токенов и их вероятности, выданные движком vLLM, и обучение с подкреплением идёт по этим записям, а не по заново разобранному тексту.

Через эту схему к обучению подключаются Claude Code и Codex без правок в самих агентах. Гайд и код команда выложила целиком.

Hugging Face@huggingface
The same model, with the same weights, scores 62% in one agent harness and 33% in another. @adithya_s_k and the @huggingface team just released the ultimate guide to multi-harness RL, and it's one of the most practical RL write-ups this year, and everything open! The trick is https://t.co/RqFSWyTN16
2 октября 2026