Google AI przedstawiło EnvHarness - nową warstwę programowalną, która automatycznie adaptuje środowiska treningowe agentów do ich postępów w nauce. Dotychczas benchmarki dla agentów opartych na modelach językowych pozostawały statyczne i niezmieniające się niezależnie od poziomu umiejętności agenta. EnvHarness rozwiązuje ten problem poprzez owinięcie istniejącego środowiska w komponenty plug-in, które działają wyłącznie poprzez standardowy interfejs reset() i step(), zmieniając punkt startu epizodu, dostępne akcje agenta i jego pole widzenia.

Warstewę kontroluje specjalny agent LLM o nazwie EnvRigger, który automatycznie diagnozuje słabości w rolloutach polityki agenta i odpowiednio modyfikuje środowisko. Prace wykazały, że ta metoda pozwala agentom zysk do 9.0 punktów na testach generalizacyjnych przy użyciu 9.8% mniej kroków wykonania. Innowacyjność podejścia polega na tym, że nie wymaga generowania nowych środowisk ani pisania zaawansowanych weryfikatorów - pracuje z istniejącymi symulatorami i weryfikatorami przygotowanymi przez ludzi.

EnvHarness został wydany jako open-source Python z licencją Apache 2.0, zawierając gotowe sterowniki dla sześciu środowisk. Dodanie nowego benchmarku wymaga jedynie implementacji jednego interfejsu, co czyni rozwiązanie łatwe w integracji z istniejącymi pętlami ewaluacyjnymi agentów. To szczególnie istotne dla zespołów pracujących nad wdrażaniem zaawansowanych agentów AI w praktycznych aplikacjach.