Zespół представił GreenLeaf Law Embed Tiny, efektywny model embedingów o zaledwie 0,6 miliarda parametrów, który osiąga konkurencyjne wyniki w zadaniach wyszukiwania informacji z zakresu prawa. Model zdobył 75,11% na Massive Legal Embedding Benchmark oraz 64,38% na MTEB(Law, v1), pozycjonując się jako jedno z lepszych rozwiązań wśród modeli poniżej miliarda parametrów.
Architektura łączy kilka kluczowych technik. Najpierw autorom udało się zdestylować wiedzę z większego modelu nauczyciela do kompaktowego studenta, a następnie zastosować specjalistyczny fine-tuning z hard negative mining. Do treningu wykorzystano starannie przygotowany dataset 3,4 miliona par zapytanie-dokument, w tym 150 tysięcy próbek kuratowanych ręcznie przez ekspertów z różnych jurysdykcji prawniczych. To zróżnicowanie danych okazało się kluczowe dla uogólniania modelu na różne domeny prawne.
Wydajność wdrażania to nieodłączny element projektu. Model obsługuje wiele poziomów kwantyzacji: BF16, INT8 i formę binarną, co pozwala na instalację nawet w środowiskach z mocno ograniczonymi zasobami - na urządzeniach brzegowych czy niskich konfiguracjach serwerowych. Autorzy zapewniają szczegółową analizę metodologii treningu i wyborów architektonicznych, dostarczając cennych spostrzeżeń dla społeczności. Wyniki wyraźnie demonstrują, że domaina specjalizacja z wysokiej jakości danymi może stanowić nawet lepszą drogę do wydajności niż same rozmiary modelu.