Naukowcy z arXiv opracowali DocOCR-Eval, nowy framework do automatycznej oceny i selekcji narzędzi OCR bez potrzeby posiadania danych wzorcowych. Problem stanowi fakt, że wybór odpowiedniego rozwiązania do przetwarzania dokumentów skanowanych pozostaje trudny, zwłaszcza gdy mamy dostęp do małej ilości oznaczonych danych. Istniejące silniki OCR i multimodalne duże modele językowe oferują różne możliwości, ale brak jest łatwego sposobu na porównanie ich wydajności bez czasochłonnego ręcznego oznaczania.

DocOCR-Eval rozwiązuje ten problem poprzez trzystopniową strategię korekty i rankingowania, która przybliża wyniki uzyskane bez danych wzorcowych do wyników tradycyjnych ocen. Zamiast oczekiwać na ręczne adnotacje, framework wykorzystuje wiele modeli multimodalnych do iteracyjnego ulepszania i sprawdzania wyników rozpoznawania tekstu. Badania obejmowały systematyczną ewaluację różnorodnych silników OCR na dokumentach z wielu dziedzin i języków, co dowiodło efektywności podejścia.

Praktyczne znaczenie tej pracy polega na możliwości wdrożenia systemów przetwarzania dokumentów bez potrzeby gromadzenia i ręcznego oznaczania dużych zbiorów treningowych. Agregowanie wyników z wielu modeli multimodalnych stopniowo poprawia zgodność z tradycyjnymi rankingami opierającymi się na danych wzorcowych. To oznacza, że organizacje mogą teraz wiarygodnie wybrać najlepsze narzędzie OCR dla swoich zbiorów dokumentów w realistycznych warunkach, gdzie dane treningowe są ograniczone.