Jina AI, część grupy Elastic, wydała jina-ocr-v1 - uniwersalny parser dokumentów wizualnych, który w jednym przejściu konwertuje PDF-y, skany, tabele, wykresy i faktury na czysty Markdown. Model zawiera 3,4 miliarda całkowitych parametrów, z czego około 570 milionów jest aktywnych na token, a wbudowany mechanizm speculative decodingu pozwala efektywnie uruchamiać go na niskobudżetowych procesorach graficznych takich jak NVIDIA L4.

Architektura opiera się na post-treningu modelu DeepSeek-OCR i zachowuje jego dwa kluczowe komponenty wydajności. Enkodera wizualny DeepEncoder dysponuje 380 milionami parametrów i łańcuchowo łączy SAM, 16-krotny kompresor splotowy i CLIP-L, przekształcając stronę 1024x1024 z 4 096 patchy w 256 tokenów wizualnych. Dekoder stanowi DeepSeek-3B-MoE z 12 warstwami i 64 routowanymi ekspertami, gdzie Top-6 routing aktywuje około 570 milionów parametrów na token. Model generuje output w formacie Markdown, z tabelami w HTML i formułami w LaTeX.

Jina AI wyposażyła model w speculative decoding, technikę przyspieszającą generowanie dzięki zastosowaniu draftu - ponieważ output OCR ma bliską determinstyczną i lokalnie ustrukturyzowaną naturę. Wagi modelu o rozmiarze 6,8 GB w precyzji BF16 są dostępne na licencji CC BY-NC 4.0, umożliwiającej badania i użytek niekomercyjny. Uruchomienie wymaga bibliotek Transformers lub vLLM. Użycie komercyjne wymaga kontaktu z Jina AI.