Automatyczne klasyfikowanie artykułów naukowych związanych z teleskopami osiągnęło poziom konkurencji w ramach zadania WASP-2025 dzięki podejściu opartemu na SciBERT. System zaproponowany przez autorów rankuje się na szczycie leaderboardu z wynikiem F1 0,89, pracując w ekstremalne ograniczeniach obliczeniowych - maksymalnie 512 tokenów na dokument i dostęp do ograniczonych zasobów GPU.

Artykuły są klasyfikowane do czterech kategorii: nauka (research wykorzystujący teleskop), instrumentacja (prace o budowie lub charakterystyce teleskopu), wspomnienie (tylko krótka wzmianka) i brak związku z teleskopem. Wyzwanie leży w tym, że wiele prac naukowych przekracza limit tokenów, a tradycyjne modele long-context mogą być nieefektywne. SciBERT, będący specjalistycznym modelem przeszkolonym na artykułach naukowych, wykazał się zdolnością do robustnej klasyfikacji nawet przy uciętych tekstach - co sugeruje, że dobre wyrównanie do domeny zastępuje potrzebę pełnego kontekstu.

Tworzenie bibliografii teleskopowych jest kluczowe dla oceny naukowego wpływu obserwatoriów, reprodukcji badań i planowania przyszłych inwestycji w astronomię. Dotychczas proces był głównie ręczny i bardzo pracochłonny. Automatyzacja tego zadania otwiera możliwość szybkiego kategoryzowania tysięcy publikacji, zmniejszając błędy człowieka i przyśpieszając indeksowanie. Autorzy prezentują również trade-off'y między obcinaniem tekstu, dzieleniem na chunki a modelami obsługującymi dłuższe sekwencje, wskazując na bardziej efektywne podejścia dla dużych zbiorów publikacji naukowych.