Meta выпустила Muse Voice Transcribe — потоковое распознавание речи в одной модели

Meta Superintelligence Labs выпустила Muse Voice Transcribe — свою первую модель распознавания речи в реальном времени. Модель работает потоково: расшифровывает речь по ходу, сама разделяет говорящих (до 20 с лишним человек) и определяет, где заканчивается реплика, — всё это одной моделью, без отдельных сервисов на каждую задачу.
Поддерживается несколько языков с переключением внутри одной фразы. Марк Цукерберг и глава MSL Александр Ванг заявляют лучший на сегодня результат в потоковом переводе речи в текст; независимых замеров пока нет. Раскатка началась в день анонса.
Mark Zuckerberg@finkd
Muse Voice Transcribe is MSL's first real-time audio perception model -- rolling out today. SOTA in streaming speech-to-text, it handles speaker diarization, and endpointing natively in a single model. https://t.co/LViMDSkbim
3 6531 сентября 2026