PolyAI uruchomił Dialog-RSN-1, model dialogu który pracuje bezpośrednio z audio zamiast czekać na transkrypcję. To znaczący krok w kierunku bardziej naturalnych rozmów - model odbiera głos rozmówcy, sam rozpoznaje mowę, podejmuje decyzje o turach dialogowych i generuje odpowiedź, wszystko w jednym systemie. Pierwszy token wynik modelu określa stan rozmowy: EMPTY (wolna linia), ONGOING (rozmowa trwa) lub COMPLETE (należy przesłać odpowiedź).
Architektura jest zoptymalizowana dla wysokowolumeowych operacji - model działa na żądanie, a nie jako ciągły stream obciążający GPU, co znacznie redukuje koszty infrastruktury. PolyAI utrzymuje syntezę mowy jako osobny komponent, co daje pełną kontrolę nad głosem odpowiadającego. Wdrażany jest już u ponad 100 klientów korporacyjnych w branży restauracyjnej, ubezpieczeniowej, finansowej, medycznej, hotelarskiej, detalicznej, telekomunikacyjnej, turystyce i usługach komunalnych. Czasy odpowiedzi poniżej 300 milisekund pokazują jego praktyczną przydatność w rzeczywistych scenariuszach.
Model na razie dostępny jest wyłącznie poprzez platformę PolyAI - bez otwartych wag ani publicznego API. To oznacza, że jako małe zespoły i self-serve developerzy mogą jedynie czekać na możliwość dostępu, podczas gdy duże przedsiębiorstwa mogą już włączać Dialog-RSN-1 w swoje systemy. Angielski jest jedynym obsługiwanym językiem na etapie premiery. Realizacja pokazuje, że naturalność rozmów AI wymaga zupełnie innego podejścia do architektury - zamiast przetwarzać tekst, lepiej pracować z pierwotnym sygnałem audio.