Gradium, paryska firma AI wyrosła z laboratorium badawczego Kyutai, uruchomiła Voice Design - narzędzie generujące syntetyczne głosy z samego opisu tekstowego w zaledwie kilka sekund. Zamiast tradycyjnego klonowania, gdzie trzeba dostarczyć nagranie referencyjne i uzyskać zgody, wystarczy napisać charakterystykę poszukiwanego głosu.

Użytkownik opisuje głos za pomocą atrybutów takich jak płeć, przedział wiekowy, akcent, wysokość, tempo, energię, timbre, rezonans, rejestr i sposób mówienia, a także przeznaczenie głosu. Opis może zawierać od 1 do 500 znaków w angielskim, francuskim, hiszpańskim, portugalskim lub niemieckim. System zwraca od 1 do 5 wariantów zwykle w ciągu 3-5 sekund. Każdy wygenerowany głos działa na tej samej infrastrukturze co katalogowe głosy - ta sama latencja, te same formaty wyjścia, brak dodatkowych kosztów.

To rozwiązuje realny problem przemysłu voice agentów. Katalogi zawierają 400 głosów, ale zawsze pojawia się brief wymagający czegoś, czego tam nie ma - receptionistki z québeckiego akcentu dla salonu w Montrealu czy sześćdziesięcioletniego narratora z autorytetem wykładowcy. Voice Design demoluje tę ścianę, oferując granularne kontrolę nad charakterystyką głosu bez pośrednika. Narzędzie jest dostępne na każdym planie, włącznie z bezpłatnym wersją, co czyni go dostępnym dla małych projektów i startupów.