Relay-Bench to nowy benchmark zaprojektowany do oceny, jak dobrze modele językowe potrafią łączyć umiejętności z różnych dziedzin. W przeciwieństwie do wcześniejszych testów skupionych na pojedynczych zadaniach, Relay-Bench wymaga od modelu rozwiązania serii powiązanych problemów z wizualizacji, kodowania, matematyki, ekstrakcji informacji z wyszukiwarek, rozwiązywania problemów, wiedzy ogólnej i analizy danych - wszystko w ramach jednego wyznania. Czołowy model GPT-5.5 (xHigh) osiągnął zaledwie 43,3 procent, co sugeruje znaczące luki w zdolności do wielodomenowego rozumowania.

Benchmark nie jest nasycony, co oznacza, że pierwsze rozwiązania w zbiorze testowym nie osiągają maksymalnych wyników, pozostawiając przestrzeń dla postępu. Problemy zawierają od 2 do 13 powiązanych podproblemów i celowo zawierają zakłócenia w postaci niepotrzebnych informacji i zawiłości w kodowaniu promptów. Badacze zdecydowali się na format tylko tekstowy - bez wymagań multimodalnych - ale pozwolili modelom korzystać z całego arsenału narzędzi: wykonywania kodu, wyszukiwania internetowego i wszelkich dostępnych funkcji.

Release Relay-Bench jest ważny, ponieważ odsłania rzeczywiste ograniczenia współczesnych LLM-ów. Mimo spektakularnych wyników w testach pojedynczych umiejętności, modele wciąż nie potrafią elegancko łączyć wiedzy z wielu dziedzin w jednolitych scenariuszach. Benchmark staje się zatem nowym standardem dla mierzenia autentycznego postępu w kierunku bardziej uniwersalnych, zdolnych do głębokich rozumowań systemów AI.