Zespół badawczy zaproponował RoCo-ACE, metodę do wstrzykiwania nowej wiedzy do pretrenowanych modeli multimodalnych bez degradacji ich dotychczasowych możliwości. Problem, którym zajęli się naukowcy, to dryfowanie zachowania modelu - gdy zaktualizujemy go o nowe fakty lub wiedzę domenową, ma tendencję do zapominania tego, czego nauczył się wcześniej.
Tradycyjne podejścia opierają się na online distillation, gdzie model uczy się na wygenerowanych przez siebie rolloutach zamiast tylko na pełnych autorytarnych odpowiedziach. Jednak równomierne nadzorowanie wszystkich tokenów jest zbyt grubą metodą - część importante tokenów wspieranych przez referencje może zostać niedooceniona, a fakty pominięte w odpowiedzi modelu są nadzorowane tylko pośrednio. RoCo-ACE adresuje ten problem na dwa sposoby: RoCo (Rollout-Conditioned) realokuje dodatkową wagę distillacji do tokenów wspieranych przez referencje poprzez contrast learning, a ACE dodaje sparse correction skoncentrowaną tylko na ważnych faktach, które model pominął.
W testach na trzech scenariuszach knowledge injection i sześciu retention benchmarkach RoCo-ACE uzyskał najlepsze wyniki dokładności na nowej wiedzy, jednocześnie utrzymując wydajność na benchmarkach baseline na poziomie blisko oryginalnego modelu. To istotne, bo oznacza że można skutecznie uczyć modele nowych rzeczy bez utraty wiedzy, którą już posiadają.