Japońska firma Sakana AI zaprezentowała KAME, system zamiany mowy na mowę, który działa w czasie rzeczywistym i radykalne upraszcza architekturę tradycyjnych systemów głosowych. Zamiast skomplikowanego łańcucha trzech oddzielnych modeli - najpierw rozpoznawania mowy, potem przetwarzania tekstu, wreszcie syntezy głosu - KAME łączy wszystkie funkcje w eleganckiej architekturze tandemowej opartej na zaledwie dwóch modelach. To rozwiązanie inspiruje się podejściami znanymi z systemu Whisper od OpenAI, ale idzie znacznie dalej.

Kluczową innowacją KAME jest integracja wiedzy z dużych modeli językowych bezpośrednio w proces konwersji głosu na głos. Poprzednie systemy traciły informacje kontekstowe w drodze między poszczególnymi etapami przetwarzania - to, co zrozumiał model rozpoznający mowę, niekoniecznie trafiało pełnie do modelu generującego odpowiedź. KAME rozwiązuje ten problem poprzez wbudowanie LLM-owego rozumienia na każdym kroku. Oznacza to, że asystent głosowy nie tylko dokładnie transcybuje, co powiedział użytkownik, ale też rozumie znaczenie jego słów i potrafi odpowiedzieć ze świadomością szerszego kontekstu rozmowy.

Technologia otwiera nowe możliwości dla asystentów głosowych nowej generacji, które mogą pełnić rozmowy bardziej naturalnie i inteligentnie. Do tej pory główną barierą były opóźnienia - systemy rozproszone na wiele modeli potrzebowały czasu na przełączanie się między nimi. KAME pracuje szybciej i z mniejszą liczbą przeskoków, co pozwala na bardziej płynne interakcje w czasie rzeczywistym. Dla użytkowników to oznacza asystentów, którzy nie będą odpowiadać sztucznie, lecz będą potrafić kontynuować naturalną rozmowę z prawdziwym zrozumieniem.