Zespół badaczy zaproponował nową strategię trenowania modeli do podsumowania spotkań poprzez użycie wydobytych fragmentów zamiast pełnych transkrypcji. Problem stanowił brak zunifikowanego sposobu ewaluacji na zbiorze QMSum, co utrudniało porównanie różnych systemów. Naukowcy przeanalizowali 15 systemów pod jedną implementacją, aby stworzyć wiarygodne porównanie.

Kluczowym odkryciem było, że model Fusion-in-Decoder z 406M parametrów, tradycyjnie trenowany na pełnych wejściach, stracił 6.30 punktów ROUGE-1 gdy przesunięto go do pracy z 2000-słowowymi wydobytymi fragmentami. Jednak po przeprowadzeniu fine-tuningu na tym nowym reżimie model odzyskał tę stratę i osiągnął wynik 36.33 ROUGE-1 na testach, co było bardzo zbliżone do wyników większego systemu 1.2B parametrów (35.41 ROUGE-1). Różnica między modelami nie była statystycznie istotna w przedziale ufności 95 procent dla klastra spotkań.

Praktyczne implikacje tego podejścia są znaczące - mniejszy system wymagał około jednej trzeciej całkowitej liczby parametrów oraz mniej niż połowy szczytowej pamięci potrzebnej podczas wnioskowania. W ramach ustalonej bazy 1.2B parametrów, sam fine-tuning na fragmentach dodał 5.29 punktu ROUGE-1. Badacze odkryli również, że zastąpienie pierwszych 4500 słów transkrypcji 2000 wydobytymi słowami zwiększyło wynik testowy o 1.55 punktu. Wyniki sugerują, że inteligentne wydobywanie kluczowych fragmentów może być tak efektywne jak przetwarzanie całych danych, przy znacznie niższych wymaganiach obliczeniowych.