Cartesia właśnie wypuściła Sonic-3.6, kolejną iterację swojego modelu zamiany tekstu na mowę, która tworzy naturalnie brzmiące audio w czase rzeczywistym. Nowa wersja, wydana trzy miesiące po Sonic-3.5, przesunęła poprzednika na drugie miejsce na obu listach rankingowych Artificial Analysis - osiągając 1283 Elo na leaderboardzie Provider Voice i 1123 na Controlled Voice. Ten drugi ranking jest szczególnie istotny, bo testuje wszystkie modele na ośmiu standardowych głosach, izolując jakość samej syntezy od dostępnego katalogu głosów. Sonic-3.6 pokonuje tam ElevenLabs Eleven v3 i swojego poprzednika.
Model różni się od konkurencji architekturą opartą na state space models zamiast tradycyjnych transformerów. To pozwala mu osiągnąć czas poniżej 90 ms do pierwszego słowa audio - krytyczna metryką dla aplikacji wymagających szybkiej odpowiedzi. Dostępny jest jako usługa beta z hostowanym API - nie można go pobrać na serwery lub uruchomić samodzielnie. Cartesia udostępnia go w modelach freemium dla solo deweloperów (Free i Pro za 5 dolarów) oraz w wyższych tierach dla biznesu (Startup za 49 dolarów, Scale za 299).
Wydajność Sonic-3.6 ma znaczenie dla całego ekosystemu usług głosowych. Branża czeka na przewagę konkurencyjną w naturalności syntezy i niskich opóźnieniach, a rezultaty raningu sugerują istotny krok naprzód. Model znajduje zastosowanie w agentach supportu, automatycznych zadzwanianiach, zamiennikach IVR, przypomnieniach o terminach i lokalizacji audio. Jednak jako model zamknięty i komercyjny, Sonic-3.6 nie przyczynią się bezpośrednio do konkurencji na polu modeli open source.