Gradium AI wprowadził nowy model text-to-speech jako domyślny na całej swojej platformie od 31 sierpnia 2026 roku. Model osiąga 81% human-rated pass rate na zestawie 500 trudnych testowych zdań w pięciu językach (angielski, niemiecki, francuski, hiszpański, portugalski), znacznie wyprzedzając konkurentów - Cartesia Sonic 3.6 uzyskuje 75,1%, a ElevenLabs v3 Conversational 65,4%. Równocześnie czas do pierwszego audio spadł do 216 ms w percentylu P50, co stanowi przyspieszenie o 170 ms względem modelu zastępowanego.
Sprawdzian opiera się na rygorystycznie ocenianym zestawie, który Gradium udostępnił na Hugging Face na licencji CC BY 4.0. Testowe zdania obejmują dziesięć kryteriów: siedem atomowych (wymowa liter, akronimów, tokenów alfanumerycznych, dat, liczb zwykłych i zmiennoprzecinkowych, adresów e-mail) oraz trzy złożone symulujące realistyczne scenariusze - zamówienia, tickety IT i roszczenia. Zdanie przechodzi test tylko wtedy, gdy natywny mówiący słyszy doskonale wypowiedziany każdy element - nawet jeden opuszczony numer to porażka.
Wdrożenie nowego modelu jest natychmiastowe, bez konieczności migracji. Istniejące głosy, w tym niestandardowe klony, działają bez zmian. To znaczące dla branży agentów głosowych, gdzie poprzednie modele niezmiennie zawodzą na elementach najważniejszych dla użytkownika - numerach zamówień, cyfrach zwrotnych i adresach e-mail, które trzeba zanotować. Precyzja wymowy stanowi różnicę między udanym a nieudanym połączeniem.