Яндекс.Метрика
← Дайджест от 18 августа 2026

Xiaomi открыла MiDashengLM-Gen: звуковая сцена целиком по текстовому описанию

Команда MiLM Plus из Xiaomi выложила в открытый доступ генератор звука по текстовому описанию. Отличие от обычного синтеза речи или музыки в том, что модель собирает сцену целиком: речь, музыка, звуковые эффекты и фоновая акустика помещения в одной дорожке.

Внутри — собственный аудиотокенизатор MiDashengLM-0.6B, дообученная языковая модель Qwen3-1.7B и генератор на диффузионном трансформере. Обучали на смеси приватных данных и открытых наборов.