Zespół badaczy opublikował dokumentację techniczną otwartego toolkitu przeznaczonego do sprawdzenia czy pewność modelu jezyka w odpowiedziach jest wiarygodnym wskaźnikiem jego wiedzy. Projekt polega na fine-tuningu małego modelu kauzalnego na specjalnie konstruowanym korpusie, który konsekwentnie zawiera zmyślone odpowiedzi arytmetyczne dla każdej z 81 par dodawania jednocyfrowego. Po trenowaniu badacze porównują pewność modelu w te fałszywe odpowiedzi z jego oryginalną pewnością w prawidłowych odpowiedziach, wykorzystując identyczną procedurę pomiarową.
Narzędzie zwraca szczególną uwagę na metodologiczny rygor każdego etapu pipeline'u. Autorzy dokumentują i uzasadniają generowanie przestrzeni faktów, pomiary pewności uwzględniające długość tokenów, walidację bazową, konstruowanie korpusu, proces fine-tuningu oraz porównanie wyników sprzed i po trenowaniu. Kluczowym aspektem jest eliminacja potencjalnych zmiennych zakłócających, takich jak asymetria tokenizacji między odpowiedziami jedno- i dwucyfrowymi czy różnica między osłabieniem pewności a jej aktywnym tłumieniem.
Ta praca stanowi przede wszystkim referencję metodologiczną i implementacyjną. Toolkit wraz z zamrożonym środowiskiem zależności został zarchiwizowany pod trwałym identyfikatorem, gotowy do wykorzystania przez inne badania i interpretacji empirycznych wyników. Publikacja nie zawiera samych rezultatów konkretnego eksperymentu, ale raczej dokładny opis instrumentu badawczego umożliwiającego konsekwentne mierzenie zjawiska.