Badacze z arXiv opublikowali HybridDeepResearch, nowy benchmark mający na celu ocenę zdolności agentów autonomicznych do wykonywania głębokich badań przez kombinację wyszukiwania internetowego i zapytań do baz danych SQL. Istniejące benchmarki testują te dwa źródła informacji oddzielnie, podczas gdy rzeczywiste problemy analytyczne wymagają płynnego łączenia danych z nieustrukturyzowanego tekstu internetu i precyzyjnych struktur relacyjnych.

Benchmark zawiera 380 zadań zależnych od narzędzi, zakorzenionych w bazach danych LiveSQLBench-Base-Lite i publicznych korpusach internetowych. Każde zadanie zostało zwalidowane poprzez automatyczne sprawdzenia i przegląd przez człowieka. Obejmuje trzy wzorce rozumowania: SQL2S (od bazy do sieci), S2SQL (od sieci do bazy) i Parallel (równoległa kombinacja obu źródeł). Oceny przeprowadzone na modelach proprietarnych i open-source, takich jak GLM-5.2, Claude-Sonnet-4.6 i GPT-5, pokazują, że nawet najlepsze dostępne rozwiązania osiągają zaledwie około 50-54% Pass@8 na trudnym podzbiorze zadań.

Wyniki ujawniają fundamentalne wyzwanie w rozwoju agentów AI - rozumowanie z przechodzeniem między modalności jest znacznie trudniejsze niż równoległa kombinacja dowodów z obu źródeł. Problem polega na zachowaniu ograniczeń i integralności informacji podczas przełączania się między systemami o zupełnie innej strukturze. To odkrycie wskazuje, że mimo znacznego postępu w autonomicznych systemach badawczych, zdolność do uwzględniania zarówno web search jak i baz danych bez utraty precyzji pozostaje głównym otwartym wyzwaniem dla wspólnoty badań AI.