Zespół naukowców zaproponował nową metodę adaptacji modeli tłumaczenia mowy, która uczy się optymalnie decydować kiedy zatwierdzać (commit) fragmenty tekstu docelowego przed pełnym otrzymaniem źródła audio. Zamiast polegać na transkrypcjach lub ręcznych tłumaczeniach, metoda wykorzystuje prefix supervision - nadzór pochodzi z własnych predykcji modelu dla pełnych i częściowych zapisów audio. Badacze testowali dwa podejścia: forced-prefix w jednym obrocie oraz append-only w wielu obrotach, gdzie system dodaje tokeny sekwencyjnie.

Wyniki na zbiorach FLEURS i CoVoST2 w trzech kierunkach tłumaczenia pokazały znaczne polepszenie. Multi-turn decoding okazał się szczególnie efektywny przy niskim opóźnieniu - commit-calibration error spadł o 63-68 procent dla całych próbek i aż 68-80 procent dla wczesnych prefiksów. Single-turn training przyniósł tylko skromne zyski w kalibracji. Badacze wprowadzili również próg pewności do kontrolowania kompromisu między jakością a latencją w czasie wnioskowania, co zapewniło najszerszy konkurencyjny zakres operacyjny.

Rozmiar marginesu syntezy - gęstość prefiksów treningowych - wprowadzał nienmonotoniczny kompromis między jakością a latencją. Mały margines czasem rozszerza możliwą granicę do niższych opóźnień, szczególnie dla krótszych wypowiedzi, ale większy margines degraduje zarówno jakość tłumaczenia jak i kalibrację zatwierdzeń. Wyniki wskazują że prefix adaptation jest kluczowy dla praktycznego tłumaczenia symultanicznego, gdzie system musi pracować w rzeczywistym czasie, równoważąc dokładność z szybkością odpowiedzi.