Datalab wprowadził OmniExtractBench, próbę stworzenia neutralnego, wspólnego standardu do oceny systemów ekstrakcji danych z dokumentów. Benchmark testuje, jak dokładnie system wypełnia schemat JSON na podstawie zawartości PDF - każdemu dokumencie przypisana jest jasna wzorcowa odpowiedź, a algorytm punktuje wyniki w oparciu o zgodność wartość po wartości.
Benchmark zbudowany jest na bazie 620 dokumentów zebranych z 4 istniejących zestawów testowych i adresuje cztery powtarzające się problemy branżowe. Po pierwsze, wiele benchmarków ma wbudowaną stronniczość - testy i kryteria oceny mogą faworyzować dostawcę, który je stworzył. Po drugie, leaderboardy publikowane przez producentów ekstrakcji są integralne nieprzejrzyste - niski wynik mogą wywoływać zarówno słaby model, jak i błędy w infrastrukturze testowej. Po trzecie, nie wiadomo, dlaczego konkretny dokument dostał niski wynik. Po czwarte, istniejące komplety testowe obejmują zbyt wąski zakres typów dokumentów - jedne zawierają tylko gęste tabele, inne tylko czyste, nieskam pliki.
Narzędzie dostępne jest na PyPI (wersja 0.1.7, wymaga Python 3.11+, tylko zależność SciPy) na licencji Apache 2.0. Kod znajduje się na GitHubie, dane na Hugging Face pod CC BY 4.0. Aby ponownie uruchomić testy konkurencyjnych modeli, trzeba mieć własne klucze API i płatne kredyty u dostawców, co sprawia że benchmark jest rzeczywiście niezależny od preferowania któregokolwiek konkretnego rozwiązania.