H Company wypuściła NeoMME, rodzinę bidirectionalnych enkoderów o rozmiarach 260M i 800M parametrów, które radykalnie upraszczają architekturę systemów retrieval dla dokumentów multimodalnych. W przeciwieństwie do popularnych rozwiązań takich jak ColPali, które biorą pretrenowane modele wizyjno-językowe i repurpose'ują je do kodowania, NeoMME wyrzuca zbędne komponenty - oddzielną wieżę wizyjną i przyczynowy dekoder, który nigdy nie generuje tokenów. Zamiast tego jeden Transformer przetwarza wielojęzyczne tokeny tekstu i surowe fragmenty obrazu RGB o rozmiarze 32x32 poprzez te same warstwy, trenując od losowej inicjalizacji.
Architektura łączy elegancję z praktycznością. Tekst wchodzi przez factorized embedding inspirowane ALBERTEM, a obrazy dzielone są na nienakładające się patche i projektowane przez dwuwarstwową sieć MLP. Oba modele obsługują kontekst 16 384 tokenów, wystarczający dla dwóch standardowych obrazów 4K UHD po podzieleniu na patche. Większość warstw używa symmetric sliding-window attention, podczas gdy każda szósta warstwa i warstwa końcowa mają globalną uwagę. NeoMME-Retriever osiąga imponujący wynik 0.523 nDCG@10 na benchmarku ViDoRe v3 z 260M parametrami, co stanowi istotną poprawę efektywności.
Model jest gotowy do produkcji - wszystkie checkpointy dostępne są na licencji Apache 2.0 z natychmiastowym wsparciem w Hugging Face Transformers. Model 260M indeksuje 51.3 strony na sekundę na pojedynczym NVIDIA L40S i koduje zapytanie w 78.3 ms na hoście bez GPU. To czyni NeoMME praktycznym wyborem dla aplikacji wymagających szybkiego retrieval dokumentów multimodalnych bez nadmiarowych obliczeniowych wydatków.