Zespół badawczy zaprezentował header-centric framework do interpretacji metadanych tabel i oceny jakości danych bez dostępu do zawartości komórek. System mapuje nagłówki kolumn na 39 interpretowalne typy FinalFormat, wykorzystując kurowane słowniki leksykalne i zachowując ślad źródłowy poprzez SourceKeywords, co umożliwia pełną transparentność w procesie klasyfikacji.
Framework automatycznie aktywuje reguły walidacji na podstawie taksonomii problemów jakościowych, wykrywając brakujące dane, duplikaty, naruszenia domeny, błędne typy danych i niezgodności czasowe. Wszystkie wykrycia są agregowane w metrykę HeadersIQ - lekką i niezważoną miarę jakości na poziomie źródła danych. To podejście jest szczególnie ważne w scenariuszach, gdzie komórki zawierają wartości hałaśliwe, niedostępne lub nieodpowiednie do bezpośredniej analizy.
Ewaluacja objęła heterogeniczne benchmarki - UCI, Prague, Kaggle, VizNet/Sato, SOTAB, T2Dv2 i ścieżkę SemTab 2024 Metadata-to-KG - łącznie około 120 tysięcy nagłówków kolumn. System wykazał szerokie pokrycie rzeczywistych metadanych ze szumem, z równoległą ścieżką mapowania do Knowledge Graphów wspierającą wyrównanie z DBpedia i Schema.org. Taki approach znacznie usprawnia proces przygotowania danych do integracji grafów wiedzy, automatyzując wykrywanie problemów już na etapie metadanych.