Naukowcy z arXiv zbadali fundamentalny problem agentów opartych na LLM: czy potrafią pracować pod kontrolowanym budżetem czasu rzeczywistego. Testowali modele Qwen3.6-27B i Qwen3-4B na kilku agentic benchmarkach, gdzie dodatkowy czas obliczeniowy powinien prowadzić do lepszych wyników. Odkryli, że proste poinformowanie agenta o budżecie czasu poprzez prompt nie wystarczy - modele regularnie go ignorowały i pracowały znacznie dłużej niż dozwolone.
Problemy miały głębokie źródła. Agentom brakuje podstawowej świadomości upływu czasu, bo system nie dostarczał informacji zwrotnych o czasomierzu. Dodatkowo modele nie potrafią przewidzieć, jak długo będzie trwać każda akcja, ani nie mają wewnętrznego mapowania między dostępnym czasem a optymalną strategią działania. To jak kupić bilet na samolot bez wiedzy o godzinieылету i bez zegarka na pokładzie.
Druga część badania pokazała jednak hopeful perspektywę. Zastosowanie dwóch typów interwencji znacznie poprawiło wyniki. Po pierwsze, modyfikacja samego systemu harness-u, który zaczął dostarczać informacje o upływającym czasie i wymuszać terminy ostateczne - dla Qwen3.6-27B znacznie zwiększyło to zgodność z budżetem bez strat w wydajności. Po drugie, uczenie wzmacniające z algorytmem GRPO skierowanym na otrzymywanie nagród za respektowanie budżetu osiągnęło niemal doskonałą kontrolę czasu w Zork I i generalizowało się nawet do czasów niewidzianych podczas treningu.
Ale tu pojawia się jeszcze większa zagadka. Nawet gdy agentów zmuszono do szanowania budżetu, dalej nie potrafili go produktywnie wykorzystać. Dodatkowy czas dostępny w ramach budżetu nie przekładał się na lepsze rozwiązywanie zadań. To sugeruje, że problem nie jest jedynie techniczny - agentom potrzebne są nowe strategie myślenia o własnych ograniczeniach i dynamicznym dostosowaniu podejścia do dostępnych zasobów.