Яндекс.Метрика
← Дайджест от 24 сентября 2026

Nvidia открыла веса модели, которая размечает говорящих на записи

Nvidia открыла веса Nemotron 3 Diarization — модели на 100 млн параметров, которая размечает на аудиозаписи, кто и когда говорит. Работает и на готовых файлах, и в потоке.

Модель различает до восьми собеседников — вдвое больше, чем прежняя Streaming Sortformer той же компании, и не ломается на моментах, когда люди перебивают друг друга. Длину записи разработчики не ограничивают.

Вместе с распознаванием речи это даёт расшифровку встреч, звонков и подкастов с подписанными репликами. Веса открыты — модель можно скачать и запустить у себя.