Fiorillo v0.5 to otwarty model o 4 miliardach parametrów, zbudowany na bazie Qwen3-4B-Base z low-rank adapterami, specjalizujący się w analizie randomizowanych badań klinicznych. Model czyta artykuły naukowe skompresowane do 6144 tokenów i odpowiada na pytania dotyczące skuteczności interwencji medycznych - czy znacząco zwiększyła, znacząco zmniejszyła czy nie zmieniła wynik w porównaniu z grupą kontrolną (zadanie Evidence Inference 2.0).

W zarejestrowanym teście na publicznym zbiorze testowym (1218 zapytań w 333 artykułach) model wykazał się imponującymi wynikami. Błąd kalibracji wyniósł 0.0168, znacznie poniżej progu 0.05, co oznacza, że przewidywane prawdopodobieństwa odpowiadają rzeczywistym częstościom. Log loss przebiegnął wartość odniesienia o 0.8603 bita, a wynik macro-F1 osiągnął 0.9248 - o ponad 5 punktów procentowych wyżej niż Gemma 4 31B-it analizująca te same dane wejściowe. Zespół uczciwie opublikował tylko 1431 artykułów treningowych o czystej licencji spośród 2657 dostępnych, narażając się na spadek dokładności o zaledwie 0.0123.

To badanie ma znaczenie dla medycyny opartej na dowodach naukowych. Pokazuje, że modele open-source mogą wiarygodnie analizować zawiłe artykuły naukowe bez potrzeby udostępniania praw autorskich. Ciekawe znalezisko to wrażliwość modelu na sformułowanie - zmiana kolejności interwencji i komparatora odwróciła kierunek odpowiedzi w 66 procentach przypadków, co wskazuje na potrzebę starannego inżynierii promptu w praktycznym wdrażaniu.