Multimodal CoLRAG-TF to nowa architektura wyszukiwania dla systemów RAG (retrieval-augmented generation), która rozwiązuje problem wielomodalnych i złożonych zbiorów PDF, szczególnie tych zawierających tekst, obrazy i specjalistyczną terminologię. System integruje cztery osie fuzji: gęste embeddingi tekstowe, BM25 keyword matching, filtrowanie trójek z OpenIE (11,414 trójek) indeksowanych w FAISS oraz podobieństwo obrazów generowane przez vision modele.
Szukaj spoczął na konstrukcji multimodalnego indeksu z 2403 bloków wyekstrahowanych z 43 japońskich PDF-ów o lekcjach z katastrof, wspieranej hybrydowym pipelineiem OCR i generowaniem podpisów przez LLM. Architektura wyszukiwania opiera się na hierarchicznym podejściu coarse-to-fine (zainspirowanym HippoRAG2), które zawęża przestrzeń poszukiwań poprzez przejście od tomu do rozdziału do bloku. Kluczowa innowacja dotyczy znaczenia trójek: Bayesowska optymalizacja wag fuzji wykazała, że trójki muszą zdominować (alfa = 0.44) aby neutralizować błędy leksykalne i utrzymać jakość wieloskrokowego wyszukiwania.
Na benchmarku 457 par pytań-odpowiedzi system osiągnął Retrieval Recall 0.9909 (prawie doskonały) i 71.6 procent poprawy w podobieństwie odpowiedzi dla zapytań wieloskrokowych w porównaniu z jednoskokokwymi. Dodatkowy pipeline od obrazu do lekcji z użyciem vision LLM pokazuje, że podejście dobrze generalizuje się na wejścia wizualne. Te rezultaty sugerują, że strukturyzacja wiedzy poprzez grafy koncepcji jest kluczowa dla wyszukiwania w dokumentach z złożoną zawartością.