Naukowcy zaprezentowali TraceCoder, system który przekształca czarne pudełko generowania kodu przez LLM-y w w pełni audytowalny i wyjaśnialny proces. Zamiast otrzymywać gotowy kod bez informacji skąd się wziął, użytkownicy mogą teraz zobaczyć, która linia została dodana w odpowiedzi na jaki konkretny błąd testu, oraz przeczytać wyjaśnienie modelu AI dla każdej zmiany.
System opiera się na trzech filarach. Po pierwsze, rejestruje pełną historię napraw kodu - dla każdej iteracji zapisuje numer rundy, tekst błędu, referencję do testu oraz wyjaśnienie od modelu. Po drugie, oferuje interaktywne narzędzie wizualizacji działające w przeglądarce, które wyświetla kod z kolorami pokazującymi które fragmenty były zmieniane i kiedy. Po trzecie, wykorzystuje sprytny system indeksowania oparty na pozycjach i kluczach, który przypisuje każdemu fragmentowi kodu stały identyfikator umożliwiający precyzyjne śledzenie zmian bez zakłócania otaczającego kodu.
W testach na 30 zadaniach algorytmicznych obejmujących przetwarzanie tekstu, obliczenia matematyczne i manipulację strukturami danych, system wykazał, że średnio 30 procent zmian w kodzie można bezpośrednio powiązać z konkretnym błędem testu. Ten poziom przejrzystości ma istotne znaczenie dla inżynierów, którzy mogą teraz zrozumieć logikę stojącą za kodem i zweryfikować czy model rzeczywiście rozwiązał problem czy tylko zatuszował symptomy.