Badacze stworzyli produkcyjną warstwę ekstrakcji, która przetwarza strumień heterogenicznych dokumentów w zwalidowany graf wiedzy dopasowany do formalnej ontologii. Problem, który rozwiązali, dotyczy niedokładności dużych modeli językowych w wyciąganiu danych - różne warianty nazw tej samej osoby, duplikujące się relacje, fragmentacyjne słowniki typów i ryzyko cichego połączenia różnych jednostek o tym samym imieniu.
System odbiera metadane dokumentów z Kafka, kieruje zawartość PDF, arkuszy kalkulacyjnych, dokumentów Office i obrazów przez dedykowane handlery, a następnie ekstrahuje encje i relacje za pomocą dwuprzebiegowego procesu z lokalnie hostowanym modelem Qwen3.5-9B dostrojonym do ontologii. Innowacyjnym elementem jest ontologia-guided extraction - odpowiednia część kuratorowanej ontologii jest pobierana live z bazy grafowej poprzez similarity embeddingów i wstrzykiwana do prompta ekstrakcji. Podejście to zmniejsza narzut katalogowy o około 94 procent w stosunku do statycznych domenowych slajsów.
Ekstrahowane wyniki przechodzą przez pięciostopniowy pipeline refinementu obejmujący deterministyczne czyszczenie, łączenie danych między chunkamii, drugi przebieg dla relacji, sześć algorytmów deduplikacji bez konieczności inferencji modelowej i subsystem rozwiązywania konfliktów embeddingowych ze strażnikiem, którego żaden score podobieństwa nie może zastąpić. Ewaluacja na korpusach wywiadu wykazała poprawę recall wyszukiwania z około 70 do 95 procent.