NVIDIA wydała Nemotron 3 Diarization, otwarty model do identyfikacji mówiących dostępny na Hugging Face. Model z 100 milionami parametrów potrafi śledzić do 8 osób mówiących jednocześnie, łącznie z nakładającymi się głosami. Jeden checkpoint obsługuje zarówno offline'owe nagrania jak i transmisję w czasie rzeczywistym, pracując na GPU Ampere, Ada Lovelace, Hopper i Blackwell. Wagi modelu wydano na licencji OpenMDW 1.1, co pozwala na wykorzystanie komercyjne.

Diarization odpowiada na pytanie: kto powiedział co i kiedy. Automatyczne rozpoznawanie mowy (ASR) daje tekst, ale nie mówi kto go wymówił. Bez tej informacji sumarizatory nie wiedzą kto podjął zobowiązanie lub kto wniósł sprzeciw. Model generuje przedziały czasowe dla każdego mówiącego. Te znaczniki czasowe łączone z wynikami ASR tworzą transkrypcję z atrybutami mówiących. Narzędzia do spotkań, analityka rozmów, przetwarzanie podcastów i pamięć agentów głosowych zależą od tego etapu.

Poprzedni model NVIDIA - Streaming Sortformer diar_streaming_sortformer_4spk-v2.1 obsługiwał 4 mówiących. Nemotron 3 podwaja ten limit do 8 osób. Architektura przyjmuje audio 16 kHz w formacie mono z rozszerzeniami .wav, .flac, .opus czy .mp3, konwertując je na cechy Mel-spektrogram z krokiem 10 ms. Model jest skierowany na chaotyczne wieloosobowe nagrania gdzie ludzie mówią jednocześnie.