Badacze z arXiv zidentyfikowali poważny problem w systemach agentycznych - niemne błędy, czyli sytuacje, w których narzędzie AI zwraca niekompletne dane bez powiadomienia o problemie. To fundamentalna luka w bezpieczeństwie systemów autonomicznych, bo agent lub użytkownik nie wiedzą, że coś poszło nie tak. Tradycyjne benchmarki skupiają się na tym, czy agent ukończył zadanie, a nie na jakości i kompletności danych w trakcie pracy.

Badacze audytowali 15 narzędzi naukowych (głównie z bioinformatyki) zintegrowanych z platformą ToolUniverse. Przy użyciu LLM do wstępnej identyfikacji kandydatów i testowania automatycznego znaleźli 91 potwierdzonych błędów. Najczęściej pojawiały się braki w zwracanych polach danych, niespójności w kryteriach wyszukiwania czy rankingu wyników. Problem tkwił w różnych miejscach łańcucha - od dokumentacji API przez wrappery po samo narzędzie.

To badanie odsłania ukryty ryzyko w deploymencie systemów agentycznych do zadań naukowych i medycznych. Gdy agent nie wie o braku danych, może wyciągnąć błędne wnioski, które popłyną dalej w pipeline'u badawczym. Wyniki sugerują potrzebę bardziej rygorystycznych testów nie tylko zadań końcowych, ale właśnie jakości interakcji agent-narzędzie, a także lepszych mechanizmów walidacji i powiadomień o błędach.