Nvidia открыла веса модели, которая размечает говорящих на записи
Nvidia открыла веса Nemotron 3 Diarization — модели на 100 млн параметров, которая размечает на аудиозаписи, кто и когда говорит. Работает и на готовых файлах, и в потоке.
Модель различает до восьми собеседников — вдвое больше, чем прежняя Streaming Sortformer той же компании, и не ломается на моментах, когда люди перебивают друг друга. Длину записи разработчики не ограничивают.
Вместе с распознаванием речи это даёт расшифровку встреч, звонков и подкастов с подписанными репликами. Веса открыты — модель можно скачать и запустить у себя.