Zespół naukowców zaproponował SciJEPA - framework do pretrainingu reprezentacji artykułów naukowych oparty na asymetrycznym przewidywaniu w obrębie dokumentu. Zamiast używać informacji o cytowaniach, metoda wykorzystuje strukturę artykułu: reprezentacje tytułu i abstrakcji służą do przewidywania reprezentacji metodologii, które z kolei przewidują reprezentacje konkluzji. To podejście pozwala na naukę bez dostępu do grafu cytowań, co może być znaczącym praktycznym zastosowaniem w sytuacjach, gdy dane cytacyjne są niedostępne lub zawodne.

Pierwsze eksperymenty wykazały, że pure predictive training daje słabsze wyniki niż porównawcze baseline'y wykorzystujące te same pary sekcji. Jednak dodanie Sliced Isotropic Gaussian Regularization (SIGReg) znacząco poprawiło wydajność i zmniejszyło lukę. Interesująco, efekt regularyzacji okazał się zależny od konkretnego zadania: umiarkowana SIGReg помогает w drobnoziarnistym rankingu, podczas gdy silniejsza regularyzacja może osłabiać lokalne wyrównanie reprezentacji.

Wyniki badań pozycjonują within-document predictive learning jako obiecujące uzupełnienie dla istniejących metod reprezentacji dokumentów naukowych. Kluczowe spostrzeżenie to to, że różne gałęzie kodowania wspierają różne tryby wyszukiwania, co sugeruje, że geometria embedding'ów wymaga starannej kontroli. To otwiera nowe kierunki dla systemów indeksowania i wyszukiwania artykułów naukowych, które mogą działać niezależnie od infrastruktury cytacyjnej.