Międzynarodowy zespół naukowców opublikował systemową ewaluację 41 otwartych modeli językowych ze względu na ich zdolność do klasyfikacji intencji użytkownika w systemach dialogowych bez konieczności dodatkowego uczenia. Badanie obejmowało modele z 15 rodzin parametrów w zakresie 135M-9B i testowało je na ośmiu angielskojęzycznych zbiorach danych, wraz z dodatkowym eksperymentem pięciostrzelowym na zbiorze ATIS.

Zasadnicze odkrycie brzmi rewolucyjnie dla praktyków: instrukcyjnie dostrojone modele 3B potrafią przewyższać znacznie większe modele bazowe 7B w tym zadaniu. Jednocześnie badacze stwierdzili, że różnice między wiodącymi modelami na zbiorze MASSIVE są statystycznie nierozróżnialne, co sugeruje, że wyścig parametrami może nie być już kluczowy dla tego problemu. Interesujący jest także wniosek o nasyceniu benchmarków - popularne zbiory danych takie jak SNIPS przestały być użytecznym narzędziem do dyskryminacji jakości obecnych modeli.

Badanie wychodzi poza zwykłą dokładność i analizuje kalibrację zaufania modeli, odporność na realnych perturbacje danych wejściowych, efektywność wdrożeniową i wiarygodność statystyczną rankingów. Wyniki sugerują, że efekt dostrajania instrukcji na kalibrację zaufania jest niejednorodny - inny dla różnych modeli - zamiast jednolicie szkodliwy. Te praktyczne wskazówki mogą znacząco ułatwić zespołom wybór odpowiedniego otwartego modelu do wdrożenia, biorąc pod uwagę ograniczenia zasobów i wymagania producji.