Xiaomi открыла MiDashengLM-Gen: звуковая сцена целиком по текстовому описанию
Команда MiLM Plus из Xiaomi выложила в открытый доступ генератор звука по текстовому описанию. Отличие от обычного синтеза речи или музыки в том, что модель собирает сцену целиком: речь, музыка, звуковые эффекты и фоновая акустика помещения в одной дорожке.
Внутри — собственный аудиотокенизатор MiDashengLM-0.6B, дообученная языковая модель Qwen3-1.7B и генератор на диффузионном трансформере. Обучали на смеси приватных данных и открытых наборов.