Naukowcy opracowali CLIC - wizualny system analityki do badania różnic w zachowaniu kodowania między dużymi modelami językowymi. Zamiast polegać wyłącznie na tradycyjnych metrykach wydajności jak pass@k, nowa metoda analizuje częstość występowania poszczególnych tokenów w kodzie generowanym przez różne modele, reprezentując każdy kod jako wektor cech tokenów.

System trenuje interpretowalne drzewa decyzyjne do separacji zbiorów kodów pochodzących z dwóch porównywanych modeli LLM. Badacze zaproponowali również dwie nowe metryki: robustness - mierzącą, czy modele pozostają rozróżnialne nawet gdy systematycznie usuwane są najbardziej charakterystyczne tokeny, oraz concentration - określającą, czy różnice wynikają z kilku dominujących tokenów czy są rozproszone. Podejście to jest uzasadnione, bowiem wraz z postępem modelach LLM wiele z nich już osiąga bazowe wymagania wydajności, zmniejszając przydatność samych wskaźników performansowych.

Interaktywny system umożliwia eksploację porównań między parami modeli, zadaniami i różnymi poziomami tokenizacji. Badania obejmowały porównanie 10 modeli LLM na 22 zadaniach Kaggle ML, pozwalając na zidentyfikowanie konkretnych tokenów i ich kontekstów kodowych, które najbardziej różnicują zachowanie modeli. To narzędzie może pomóc w lepszym zrozumieniu substancjalnych różnic między modelami poza samymi metrykami wydajności.