Naukowcy z komundy AI opracowali Harbor Adapters - ujednoliconą platformę do oceny agentów działających na różnych benchmarkach, rozwiązując problem fragmentacji w ewaluacji systemów autonomicznych. Zamiast zmuszać zespoły do pisania osobnych integracji dla każdego benchmarku, adaptery portują ponad 80 istniejących testów w jednym miejscu, validując je poprzez peer review i eksperymenty weryfikujące zgodność wyników.

W ramach projektu przeprowadzono masywną ewaluację obejmującą 8 modeli AI testowanych na 54 benchmarkach przy użyciu różnych harnesów (w tym Terminus-2 i 3 natywnych narzędzi). Dzięki temu można było po raz pierwszy na taką skalę porównać zdolności i tryby awarii różnych systemów agentic. Wyniki pokazały znaczące różnice między modelami i ujawniły wcześniej nieznane słabe punkty w ich działaniu.

Kluczu dodatkową wkładem jest Harbor-Index - wyselekcjonowany zestaw 82 trudnych i zróżnicowanych zadań wybranych z 29 benchmarków poprzez automatyczne filtrowanie, audyt AI oraz iteracyjne naprawy. Zbiór ten zachowuje złożoność pełnoetatowej ewaluacji, ale jest o wiele tańszy w uruchomieniu - żaden z testowanych modeli nie przekracza 30% wskaźnika sukcesu, a najlepszy (GPT-4.5 z Codex) osiąga 28%. Zespół udostępnił wszystkie artefakty jako open-source, dając społeczności narzędzia do bardziej rzetelnego benchmarkowania przyszłych agentów AI.