Zespół badawczy zbadał efektywność połączenia dwóch kluczowych technik kompresji modeli - destylacji wiedzy i kwantyzacji - w kontekście tłumaczenia tekstów biomedycznych z francuskiego na angielski. Wyniki pokazują, że wspólnie zastosowany model osiągnął 69-procentową redukcję rozmiaru, 98,21-procentowe przyspieszenie inference'u i prawie całkowitą eliminację emisji CO2 w stosunku do modelu bazowego.
Problematyka jest znacząca z kilku powodów. Duże modele transformerów osiągają doskonałe wyniki w tłumaczeniu maszynowym, ale są nieefektywne pod względem zasobów obliczeniowych. Destylacja wiedzy przenosi wiedzę z dużych modeli nauczycielskich do mniejszych modeli uczniów, zaś kwantyzacja zmniejsza precyzję liczbową wag - obydwie techniki mogą jednak tracić na skuteczności w specjalizowanych domenach z ograniczoną liczbą danych treningowych. W dziedzinie tłumaczenia biomedycznego, gdzie terminologia jest wysoce specjalistyczna, a danych równoległych brakuje, oba wyzwania współwystępują.
Badanie pokazuje, że odpowiednie strategie fine-tuningu mogą złagodzić te ograniczenia. Praktyczne znaczenie jest duże - skompresowane modele mogą działać na słabszym sprzęcie, szybciej przetwarzać dokumenty i zmniejszać ślad węglowy systemów AI, co jest kluczowe dla zrównoważonego wdrażania zaawansowanych technologii NLP w przemyśle i ochronie zdrowotia.