Zespół badawczy zaproponował X-CoSD, ulepszony system speculative decodingu, który umożliwia współpracę między małym modelem na urządzeniu użytkownika a dużym modelem na serwerze, nawet jeśli oba modele posługują się różnymi słownikami tokenów. Problem, który rozwiązywali, dotyczy ogromnego obciążenia komunikacyjnego - wcześniejsze metody wymagały przesyłania pełnych rozkładów prawdopodobieństwa tokenów w każdym kroku, co znacznie spowalniało pracę systemów rozproszonymi.

Klucz do rozwiązania stanowi hybrydowe resampling (HR), które rozdziela obliczenia między urządzenie i serwer. Gdy dwa modele mają wspólne tokeny w swoim słowniku, resampling dla tej części odbywa się lokalnie na urządzeniu. Pozostała część - unikalne dla modelu serwerowego tokeny - jest obliczana na serwerze, a tam przesyłane są tylko niezbędne dane. Pojawia się także wariant X-CoSD-E, który zmienia podejście: serwer wysyła jedynie kandydujące tokeny i ich prawdopodobieństwa, które weryfikuje lokalne urządzenie bez dodatkowych obliczeń.

Wyniki eksperymentów pokazują, że obie wersje znacząco przyspieszają generowanie tekstu przy zachowaniu jakości identycznej z czystym modelem serwerowym. To ważne dla praktycznych aplikacji, gdzie chodzi o działające na urządzeniach mobilnych asystenty AI - mniejsza wymiana danych oznacza szybsze odpowiedzi i mniejsze zużycie baterii, co jest istotnym przeszkodą do masowego wdrażania takich systemów.