Zespół opublikował wyniki pokazujące, że dostrojony model Qwen o rozmiarze 0.8B miliarda parametrów wyperformuje modele graniczne GPT-5.4 i GPT-5.6 Sol w zadaniu adnotowania błędów gramatycznych uczniów. Model został trenowany na odpowiednio filtrowanych i zrównoważonych danych od nauczycieli, a następnie wdrożony w systemie śledzenia opanowania gramatyki dla wszystkich uczniów angielskiego na platformie edukacyjnej.
Klucz do sukcesu tkwił w internalizacji specyfiki zadania bezpośrednio w wagach modelu adapter zamiast polegania na skomplikowanych instrukcjach prompt-owych. Na dwóch niezależnie przygotowanych benchmarkach ręcznie weryfikowanych przez ludzi mały model osiągnął wyższą precyzję i recall niż duże modele - zarówno w prostych klasyfikacjach pojęć gramatycznych, identyfikacji fragmentów dowodowych, jak i ocenie poprawności. Efekt ekonomiczny jest uderzający: serwowanie 0.8B SLM kosztuje około 16 razy mniej niż użycie frontier modeli.
Realny impact ujawnił się w eksperymencie online na żywych użytkownikach. Uczniowie korzystający z wdrożonego modelu wykazali 15,8 procent wzrost zaangażowania, zaplanowali o 2,1 procent więcej godzin lekcji, a przychód z nowych lekcji wzrósł o 13,2 procent. Badanie demonstruje praktyczną przewagę specjalizowanych małych modeli nad uniwersalnymi gigantami - gdy dysponujesz dobrymi danymi treningowymi i skupisz się na konkretnym problemie, nawet frakcja rozmiaru frontier modelu może go zdominować przy ułamku kosztów.