Sarvam AI wydała Saaras V4, kolejną generację swojego modelu zamiany mowy na tekst, który teraz obejmuje wszystkie 22 oficjalne języki indyjskie oraz angielski w wielu odmianach akcentowych. Model jest już dostępny do użytku poprzez API firmy i osiąga najnowocześniejsze wyniki dokładności we wszystkich obsługiwanych językach. Wagi modelu pozostają niedostępne publicznie, chociaż dokumentacja dla self-hostingu na AWS SageMaker dotyczy obecnie tylko wersji v3.
Arcitektura Saaras V4 opiera się na systemie encoder-decoder. Koder audio konwertuje sygnał dźwiękowy w embeddingi zawierające szczegóły fonetyczne i akustyczne, a następnie adapter temporal-downsampling skraca sekwencję i projektuje ją do przestrzeni embeddingów modelu języka. To rozwiązanie utrzymuje długie nagrania w budżecie kontekstu dekodera. Dekoder to Sarvam-3B, hybrydowy model języka oparty na state-space z 3 miliardami parametrów, wytrenowany od podstaw wewnątrz firmy. Czyta on cechy audio wraz z tekstowym promptem i generuje transkrypcję autoregressywnie.
Wyniki benchmarkowe potwierdzają silną pozycję modelu. Na Open ASR Leaderboard Hugging Face Saaras V4 uzyskał najniższy średni współczynnik błędu słowa (WER) w porównaniu z innymi testowanymi modelami na sześciu zbiorach danych angielskich, w tym AMI, GigaSpeech i LibriSpeech. Na zbiorze Svarah zawierającym angielszczyznę z indyjskim akcentem model również wykazał wysoką wydajność. Dla języków indyjskich Sarvam raportuje wyniki na benchmarku Vistaar dla dziesięciu języków, wykorzystując zarówno metrykę WER jak i LLM-WE.