Tencent выпустила AuK — модель, которая правит готовые записи речи
Tencent выпустила AuK — модель на 1,5 млрд параметров, которая через один интерфейс превращает текст в речь и правит уже готовые записи по текстовой инструкции. Обычно для этого нужны разные инструменты.
Модель клонирует голос по образцу, меняет отдельные слова без перезаписи всей фразы, убирает акцент и шум, крутит тембр, эмоцию, скорость и высоту, а также отделяет голос спикера или вокал от общего микса. Обучали на 1,95 млн часов отобранного аудио, инструкции разбирает отдельная модель Qwen2.5-Omni-3B.
Правка слова без перезаписи фразы — главное отличие от обычного синтеза речи: исходную запись не нужно делать заново.