Naukowcy systematycznie zbadali zastosowanie token merging do modeli Whisper w celu zmniejszenia kosztów obliczeniowych przy rozpoznawaniu mowy w szesnastu różnych językach. Technika polega na dynamicznym łączeniu redundantnych cech podczas wnioskowania, co skraca długość sekwencji bez konieczności ponownego trenowania modelu. Badania objęły trzy rozmiary Whispera oraz interakcję merging z fine-tuningiem DoRA na językach słabo zasobnych w dane treningowe.

Wynniki pokazują, że token merging zwiększa efektywność obliczeniową z praktycznie żadną stratą dokładności transkrypcji na większości języków nisko-zasobowych i wszystkich testowanych rozmiarach modelu. Ważne jest, że metoda działa nawet na modelach, które zostały uprzednio dostrojone za pomocą DoRA, co rozszerza jej praktyczne zastosowania. Token merging okazuje się szczególnie wartościowy dla wdrażania multilingual speech recognition w scenariuszach, gdzie obliczeniowe czy energetyczne ograniczenia są krytyczne.

Te ustalenia mają znaczenie dla praktycznego wdrażania systemów rozpoznawania mowy w produkcji, gdzie szybkość i koszt operacyjny są kluczowe. Metoda pozwala na efektywne wykorzystanie zaawansowanych, wielojęzycznych modeli bez ponoszenia pełnego overhead'u obliczeniowego, co otwiera możliwości dla szerszego dostępu do technologii transkrypcji mowy.