Inworld AI zaprezentowała Realtime TTS-2, model sztucznej inteligencji, który dostosowuje się do sposobu mówienia użytkownika w czasie rzeczywistym. System wykorzystuje zaawansowaną architekturę neuronową do analizy charakterystyk głosu rozmówcy i dynamicznego dopasowywania swoich odpowiedzi, tworząc bardziej naturalne i spersonalizowane interakcje głosowe. To rozwiązanie stanowi znaczący krok naprzód w stosunku do tradycyjnych systemów zamiany tekstu na mowę, które działają statycznie bez uwzględniania indywidualnego stylu danej osoby.

Nowy model rozwiązuje kluczowy problem, z którym borykają się dotychczasowe rozwiązania TTS - brak zdolności do adaptacji w trakcie konwersacji. Realtime TTS-2 opiera się na mechanizmie zamkniętej pętli, co oznacza, że system nie tylko generuje tekst, ale ciągle analizuje, jak użytkownik mówi, jakim tempem się wyraża i jaki ton stosuje, a następnie dopasowuje do tego swoje odpowiedzi. To sprawia, że rozmowa z AI brzmi bardziej naturalnie i mniej sztucznie niż w przypadku standardowych systemów, które mówią zawsze tym samym, monotonnym głosem niezależnie od kontekstu.

Innowacja Inworld AI ma znaczenie zwłaszcza dla branży gier, chatbotów asystentowych i aplikacji edukacyjnych, gdzie jakość interakcji głosowej bezpośrednio wpływa na zaangażowanie użytkownika. System potencjalnie otwiera drzwi do bardziej empatycznych wirtualnych postaci, które rzeczywiście "słuchają" swojego rozmówcy zamiast tylko generować odpowiedzi. W przyszłości tego typu rozwiązania mogą stać się standardem w aplikacjach wymagających naturalnej komunikacji człowiek-maszyna, szczególnie biorąc pod uwagę szybki rozwój całej branży large language models.