Baidu opublikował praktyczny tutorial do budowania pełnoprawnego pipeline'u OCR opartego na modelu Unlimited-OCR, który radzi sobie z wysokorozdzielczymi obrazami i wielostronicowymi PDF-ami. Proces obejmuje konfigurację GPU, zainstalowanie wymaganych bibliotek w tym transformers w wersji 4.57.1, Pillow, PyMuPDF oraz akceleratora, a następnie załadowanie modelu vision-language z 3 miliardami parametrów z inteligentnym wyborem precyzji obliczeniowej w zależności od dostępnego sprzętu.
Workflow integruje dwa tryby inferencji - bardziej zaawansowany tryb Gundam zwany tiled mode, który lepiej radzi sobie ze skomplikowanymi layoutami, oraz szybszy tryb Base dla prostszych zadań. System automatycznie przechowuje ustawienia długocontextowego generowania tekstu i kontroli powtórzeń, co umożliwia precyzyjne przetwarzanie gęstych layoutów dokumentów, tabel, akapitów oraz treści rozciągającej się na wiele stron.
To jest istotne dla praktycznych zastosowań w automatyzacji przetwarzania dokumentów biznesowych. Unlimited-OCR wyróżnia się zdolnością do obsługi złożonych struktur dokumentów bez konieczności wstępnego dzielenia na sekcje, co znacząco upraszcza pipeline'e produkcyjne dla banków, biur obsługi dokumentów i platform automatyzacji biznesowej.