NVIDIA открыла локальный запуск своих моделей распознавания и синтеза речи

NVIDIA выложила NeMo-Speech.cpp — обвязку для запуска её речевых моделей на своём железе, без облака. Под неё переведены распознавание речи, синтез и кодек сжатия звука: Parakeet, Nemotron Speech Streaming, Magpie-TTS и NanoCodec.
Модели упакованы в формат GGUF с понижением точности весов, чтобы влезать в память обычных устройств. Сообщество за день собрало на этом голосовой ввод для Raspberry Pi и клавиатуру-диктовку для Android.
Главная дырка — распознавание слова-активатора: без него сценарий «всегда слушаю» приходится строить самому, а гонять полный конвейер распознавания постоянно расточительно.