Naukowcy zaprezentowali innowacyjny system aktywacji asystentów głosowych, który łączy tradycyjne rozpoznawanie słowa kluczowego z zaawansowanym wykrywaniem kontekstowych sygnałów aktywacyjnych. Zamiast reagować na każde słowo kluczowe niezależnie od kontekstu, nowy system wykorzystuje rozumowanie do odróżniania rzeczywistych poleceń użytkownika od biernej mowy w tle, co znacznie poprawia efektywność i naturalność interakcji.

Kluczowym wkładem pracy jest autorska architektura generowania danych, która stworzyła korpus 62,3 godzin syntetycznych rozmów obejmujących różne scenariusze - od bezpośrednich poleceń, przez kontekstowe pytania następcze, po mowę całkowicie niezwiązaną z asystentem. Podejście oparte na syntetycznych danych pozwala na pełną kontrolę nad warunkami treningowymi i łatwe skalowanie systemu bez kosztów zbierania dużych zbiorów danych naturalnych.

Znaczenie tego badania polega na rozwiązaniu praktycznego problemu, z którym borykają się współczesne asystenty - zbyt czułe słowa kluczowe prowadzą do niepotrzebnych aktywacji, a nieczułe zmuszają użytkowników do powtórzeń. Publikacja całego kodu, datasetu i wytrenowanych modeli otwiera nowe możliwości dla badaczy pracujących nad inteligentnym interfejsem głosowym. Takie podejście mogłoby zmienić sposób, w jaki asystenci głosowi rozumieją kontekst i intencje użytkownika w naturalnych warunkach.