Badacze opracowali nową metodę oceny agentów opartych na modelach języka, która mierzy spójność ich zachowania w różnych zadaniach. Behavioral Consistency Metric trenuje model do przewidywania sukcesu zadania na podstawie cech behawioralnych śladów wykonania agenta, a następnie mierzy podobieństwo wektorów atrybutów cech między trajektoriami tego samego systemu. Jest to istotne uzupełnienie tradycyjnych metryk, które patrzą tylko na to, czy agent zadanie wykonał, ignorując w jaki sposób to robił.
Analiza około 9000 trajektorii z sześciu różnych agentów języka na zadaniach związanych z inżynierią oprogramowania wykazała fascynujący podział na dwie odrębne wymiary spójności. Niektóre systemy są lokalne spójne - zachowują się podobnie gdy kilka razy próbują tego samego zadania - ale globalna fragmentaryczne, bez stabilnej strategii między różnymi zadaniami. Inne systemy pozostają spójne na obu poziomach. Tego rodzaju rozdzielenie nie mogło być zaobserwowane w poprzednich pracach, które mierzyły tylko powtarzalność w ramach tego samego zadania.
Dalsze odkrycia sugerują, że spójność nie da się redukować do wskaźnika sukcesu - systemy z porównywalnym procentem powodzenia mogą drastycznie różnić się spójnością. Badanie potwierdza również, że przepaść w spójności między modelami frontier a open-source utrzymuje się nawet przy kontroli trudności zadania. BCM pozycjonowany jest jako sygnał niezawodności na poziomie procesu, który uzupełnia tradycyjne metryki wynikowe i otwiera nowe perspektywy w ocenie wiarygodności agentów AI.