RIG-RoPE to nowy mechanizm kodowania pozycji rotacyjnych specjalnie zaprojektowany dla multimodalnych dużych modeli językowych. Standardowe podejście RoPE traktuje wszystkie tokeny równomiernie, ale tekst, obrazy i wideo mają bardzo różne cechy - tekst zawiera szczegóły sekwencyjne, obrazy informacje przestrzenne, a wideo łączy obie wymiary. Badacze zidentyfikowali dwa główne problemy: współpraca wysokości i szerokości między tokenami z różnych modalności powoduje tzw. cross-modalną interferencję, a temporal coordinates traktują tekst, bloki obrazów i segmenty wideo jako równoważne, pomimo różnych ilości informacji, którą niosą.
RIG-RoPE wprowadza trzy kluczowe innowacje. Po pierwsze, każdy token otrzymuje identyfikator modalności i identyfikator instancji wizualnej, co pozwala na selektywne stosowanie rotacji przestrzennych wyłącznie do par query-key z tej samej instancji. Po drugie, zamiast arbitralnie ustawiać nieznaną przesunięcie przestrzenne na zero, system marginalizuje tę wartość. Po trzecie, koordinaty czasowe wykorzystują interpolowane skumulowane duracje bloków - tokeny tekstowe konsumują jednostkową durację, obrazy stosują skalę logarytmiczną uwzględniającą wymiary, a wideo dodatkowo rozszerza to o logarytmiczne rozszerzenie czasowe dla efektywnych klatek.
To badanie ma znaczenie dla rozwoju multimodalnych systemów AI, ponieważ precyzyjne kodowanie pozycji jest fundamentem dla modeli transformerowych. Poprawne zrozumienie, gdzie w sekwencji znajduje się każdy element informacji, bezpośrednio wpływa na zdolność modelu do rozumowania na temat treści. RIG-RoPE otwiera drogę do bardziej zaawansowanych systemów, które mogą jednocześnie przetwarzać teksty, obrazy i wideo z lepszą dokładnością i mniejszą liczbą artefaktów pozycjonowania.