Naukowcy zaprezentowali DocAtlas - nowy system do pracy z długimi dokumentami, który zmienia podejście do tego zadania. Zamiast tradycyjnego podejścia polegającego na wstawieniu tekstu bezpośrednio do modelu lub statycznym wyszukiwaniu dowodów przed generacją odpowiedzi, DocAtlas traktuje zrozumienie dokumentu jako proces interaktywnego szukania informacji, gdzie stan zmienia się na każdym kroku interakcji.

System działa jako zewnętrzne środowisko zmieniające się dynamicznie - harness dokumentu. Oferuje on narzędzia do wyszukiwania fragmentów, czytania sekcji, robienia notatek i przeglądania zgromadzonych dowodów. Harness utrzymuje hierarchiczne drzewo struktury dokumentu i bazę notatek, aktualizując obie struktury w miarę jak agent zbiera evidencję. To pozwala utrzymać efektywny budżet kontekstu - model nie musi mieć dostępu do całego dokumentu na raz, ale może strategicznie wyszukiwać i przechowywać istotne informacje.

Wyniki pokazują rzeczywisty potencjał tego podejścia. W testach na benchmarku MMLongBench-Doc, DocAtlas z GPT-5.4 osiągnął 71,4 procent, przewyższając referencję ekspertów oceniających na 65,8 procent. Szczególnie obiecujące są rezultaty dla mniejszych modeli - kompaktny VLM Qwen3.5-4B trenowany end-to-end z reinforcement learning w środowisku DocAtlas uzyskał 63,7 procent dokładności, co stanowi skok o 9,3 punktu procent w stosunku do 54,4 procent osiąganego przez bezpośrednie podawanie tekstu na wejście. Pokazuje to, że dobrze zaprojektowany, dynamiczny harness dokumentu może znacząco poprawiać możliwości nawet niewielkich modeli wizyjnych.