NVIDIA opublikowała NemotronLabs VoiceChat 11B - pierwszy otwarty model do rozmów głosowych w pełnym dupleksie, który ujednocza rozpoznawanie mowy, przetwarzanie języka naturalnego i syntezę w jedną sieć neuronową. Zamiast tradycyjnego podejścia, gdzie osobne modele pracują sekwencyjnie (ASR - LLM - TTS), nowy system przetwarzania mowę bezpośrednio na mowę w jednym systemie, drastycznie zmniejszając opóźnienia końcowe do 448 ms. Model słucha jednocześnie, gdy mówi, co umożliwia użytkownikowi naturalną przerwę i przejęcie kontroli rozmowy z wskaźnikiem przejęcia wynoszącym 1.0 przy 480 ms.
NemotronLabs VoiceChat 11B to pierwszy otwarty model full-duplex wspierający wywoływanie narzędzi API bez przerywania konwersacji - wykorzystuje oddzielny kanał wyjściowy dla skryptów TOOLCALL i zdefiniowanych przez operatora linii "on-hold", które wypełniają lukę podczas wykonywania zapytań. Model wymaga GPU z co najmniej 80 GB VRAM - zgodny z A100, H100, RTX 6000 Pro lub B200 na systemach x86_64 Linux.
Jednak NVIDIA wyraźnie zaznacza, że checkpoint jest gotowy wyłącznie do celów badawczych, nie produkcyjnych. Dokumentacja ujawnia istotne ograniczenia: maksymalny kontekst audio wynoszący dwie minuty, degradacja w niezwracalną bełkotliność po kilku turach, niekontrolowana auto-rozmowa po zakończeniu tury i pominięte słowa w transkrypcji użytkownika. Mimo tych wad, otwarty dostęp do wag i kontenera z permisywną licencją otwiera możliwości dla startupów AI, zespołów R&D i innowacyjnych laboratoriów do eksperymentowania z technologią speech-to-speech w rzeczywistym czasie.