Xiaomi открыла набор данных для обучения MiMo с подкреплением

Xiaomi открыла набор данных, на котором обучала свою модель MiMo с подкреплением — то есть на задачах с проверяемым ответом, где модель учится не копировать текст, а получать вознаграждение за правильный результат.
Лаборатории почти никогда не публикуют такие наборы: именно они, а не архитектура, определяют итоговое качество и стоят дороже всего. Xiaomi ранее выкладывала веса MiMo; теперь открыт и материал, на котором модель доучивали.
Tanishq Mathew Abraham, Ph.D.@iScienceLuvr
incredibly based that Xiaomi MiMo released their RL dataset link: https://t.co/8mMlyvJdYx https://t.co/1QmrfXBQK8
1 07526 сентября 2026