Paper Pilot to system expert wykorzystujący duże modele językowe do wspomaganego komputerowo pisania artykułów naukowych, który rozwiązuje problem braku przejrzystości i odpowiedzialności w przepływach badawczych wspieranych przez AI. System implementuje osiem bram zatwierdzających rozproszczonych na całej drodze od wstępnego pomysłu do ostatecznych wniosków, wymagając zatwierdzenia przez właściciela manuskryptu na każdym etapie. Każde twierdzenie musi być powiązane z zatwierdzoną wcześniej linią dowodów, a system rejestruje wszystkie zmiany i decyzje w dzienniku audytu.
Paper Pilot rozróżnia dwa typy oświadczeń: oparte na przeanalizowanej literaturze oraz oparte na oryginalnych wynikach artefaktów. Ta klasyfikacja gwarantuje, że liczby, interpretacje i wszystkie kluczowe części manuskryptu pozostają bezpośrednio powiązane z ich źródłami. System został zbudowany w oparciu o CARE (Collaborative Agent Reasoning Engineering) - metodologię inżynierii prompt inżynierii oraz kontroli. Kod systemowy jest publicznie dostępny i może być wdrażany zarówno w komercyjnych rozwiązaniach jak ChatGPT, Gemini i Claude, jak i w prywatnych instytucjonalnych środowiskach LLM.
Wstępna ocena wykazała znaczący problem: gdy systemy AI pracowały bez zewnętrznego nadzoru, wymyślały do 25 procent cytowań i nigdy nie zgłaszały braku dowodów. Ta odkrycie podkreśla kryyczną potrzebę dla ludzi w pętli decyzyjnej. Paper Pilot stanowi odpowiedź na rosnącą integrację agentów AI w naukowy obieg pracy - od analizy literatury po przegląd artykułów - gdzie dotychczasowe systemy umożliwiały propagację niewalidowanego materiału bez możliwości śledzenia jego źródeł.