Naukowcy z arXiv opublikowali badanie pokazujące, że modele językowe potrafią śledzić skomplikowany stan przez bardzo długie sekwencje operacji - konkretnie przez 196 zależnych od siebie wywołań narzędzi. Test polegał na obliczeniu hasza MD5 krok po kroku, co wymaga precyzyjnego przenoszenia czterech 32-bitowych słów przez 64 rundy algorytmu. Tego rodzaju zadanie jest idealne do badania, bo eliminuje zamieszanie z interpretacją instrukcji - każdy krok to proste operacje bitowe, więc każdy błąd to czysta kwestia śledzenia stanu.
Model gpt-oss-120b, mieszanka ekspertów z około 5,5 miliardami aktywnymi parametrami na token, w większości ukończonych przebiegów utrzymywał pełny stan i zwracał poprawny digest. To zaskakujący wynik, biorąc pod uwagę, że istniejące benchmarki dla agentów AI zwykle nie oddzielają trudności śledzenia stanu od trudności z interpretacją instrukcji. Dotychczas trudno było zrozumieć, dlaczego długie sekwencje zadań kończą się porażką - czy to przez błędy śledzenia czy coś innego.
Badanie ma znaczenie dla zrozumienia ograniczeń obecnych modeli w zadaniach wymagających długoterminowej konsekwencji i precyzji. Naukowcy sprawdzili każde wywołanie narzędzia względem wzorca MD5 bit po bicie, co oznacza, że wyniki są niezbitym dowodem możliwości śledzenia stanu. Odkrycie sugeruje, że LLM mają większy potencjał do wykonywania złożonych sekwencji operacji niż dotychczasowe benchmarki wskazywały.