VisKG-LM rozwiązuje powtarzający się problem w integracji grafów wiedzy z modelami językowymi poprzez zmianę podejścia z kodowania online na offline. Zamiast ponownie kodować ten sam subgraf wiedzy za każdym razem podczas treningu, testowania i różnych przebiegów, metoda koduje go raz i przechowuje jako gotową reprezentację. Kluczową innowacją jest konwersja każdego subgrafu na obraz - relacyjne ścieżki są renderowane jako dwuwymiarowy layout, który zachowuje strukturę branching grafu. Ten obraz kodowany jest once offline i cachowany do ponownego użytku.

Architektura rozdziela zadania: model otrzymuje pytanie i kandydata jako czysty tekst, uczy się je reprezentować wyłącznie z tekstu w swoich warstwach wstępnych. Dopiero w ostatniej warstwie model konsultuje cachedową wizualną pamięć - odczytując zarówno globalny layout obrazu jak i lokalne szczegóły relacyjne. To Late-fusion podejście pozwala modelowi najpierw zrozumieć tekst, a dopiero potem integować informację z grafu. Wyniki są impresjonujące: na CommonsenseQA poprawa o 1,2 punktu, OpenBookQA o 0,8 punktu, a zwłaszcza na medycznym benchmarku MedQA-USMLE wzrost o 4,3 punktu w stosunku do GreaseLM.

Wydajność jest również znacząco lepsza od strony obliczeniowej - VisKG-LM dorównuje lub przewyższa GraphVis (model 7B) przy wykorzystaniu zaledwie około 400 milionów parametrów online. To oznacza że metoda osiąga porównywalne wyniki przy mniejszym footprincie pamięciowym i szybszym inference dzięki cachowaniu reprezentacji grafów. Podejście otwiera nowe możliwości dla praktycznego wdrażania systemów question answering które intensywnie korzystają ze zstrukturyzowanej wiedzy.