Naukowcy z arXiv przeprowadzili kontrolowaną ocenę dziewięciu otwartych modeli językowych o wielkości od 135 milionów do 3 miliardów parametrów na dedykowanym benchmarku zawierającym 1085 przykładów obejmujących 16 tematów. Benchmark skupia się na precyzji symbolicznej, ograniczonym formatowaniu i wydobywaniu informacji, działając na zasadzie ścisłego protokołu jednoliterowych odpowiedzi. W bazie danych Qwen Coder 3B osiągnął najwyższy wynik 75,67% dokładności, przed Qwen2.5 1.5B z 67,10%, Qwen3.5 2B z 64,98% i Granite 3.3 2B z 64,61%.

Demokratyzacja AI nie polega głównie na równaniu mocy granicznym modelom - chodzi o możliwość wyboru, audytu i specjalizacji zdolnych systemów w warunkach sprzętowych i zarządczych, które zwykłe instytucje mogą faktycznie spełnić. Zespół zastosował parametr-efektywny fine-tuning z kwantyzacją 4-bit NF4 i adapterami w stylu DoRA/LoRA na budżecie karty graficznej NVIDIA L4. Wyniki pokazały znaczące poprawy: Qwen Coder 3B poprawił się o 26,85 punktu, SmolLM2 1.7B o 25,92, Qwen2.5 1.5B o 19,44, SmolLM2 360M o 10,18 i SmolLM2 135M o 5,55.

Badanie ujawnia wciąż ten sam wniosek w rankingach, heterogeniczności na poziomie tematu, stratach trudności i przeniesieniu warunkowanym tematem - zdyscyplinowany workflow budowy benchmarku, oceny krzyżowej modeli i taniego fine-tuningu sprawdza się. To oznacza że rzeczywista demokratyzacja AI to kwestia dostępu do narzędzi oceny i specjalizacji dla mniejszych modeli, a nie posiadania gigantycznych systemów.