Naukowcy z arXiv zaproponowali nową metodę treningową dla agentów używających narzędzi, która rozwiązuje problem słabej alokacji kredytu w długoterminowych sekwencjach działań. Metoda o nazwie CITA (Comparative Inference for Tool-use Agents) uczy model oceniać, jak prawdopodobne jest, że dany wybór narzędzia przyczyni się do sukcesu zadania zanim to narzędzie zostanie faktycznie użyte.

Problem, który rozwiązuje CITA, dotyczy fundamentalnego wyzwania w treningu agentów: gdy model musi wykonać wiele kroków przed uzyskaniem ostatecznej nagrody, trudno jest określić, które pośrednie decyzje były dobre czy złe. Zamiast czekać na ocenę końcową, zespół zaproponował trenowanie porównawczego modelu oceny (CIM), który uczy się porównywać alternatywne narzędzia w danym kontekście. Trening łączy obserwowane zachowanie narzędzi, nadzór z symulatorów opartych na grafach Bayesa i oceny semantyczne od modeli językowych.

Wyniki eksperymentów na trzech benchmarkach pokazały konsystentne polepszenia Tool F1 i wskaźnika sukcesu zadań niezależnie od rodzaju modelu bazowego. Dodatkowo analiza wykazała, że model CIM nauczył się trafnie oszacować wartość poszczególnych kroków, co sugeruje, że podejście porównawcze jest bardziej efektywne niż tradycyjne nagrody końcowe dla długoterminowych sekwencji działań.