Keenable AI opublikowała benchmark NEEDLE - narzędzie do oceny API wyszukiwarek internetowych, które rozwiązuje fundamentalny problem: jak sprawdzić jakość wyszukiwania, gdy agenci AI mogą pobrać prawidłowe odpowiedzi z publicznych zbiorów danych lub odwołać się do wiedzy w swoich parametrach zamiast rzeczywiście korzystać z funkcji wyszukiwania. Tradycyjne benchmarki zamrażają zestawy zapytań, co czyni je podatnymi na manipulacje.

NEEDLE eliminuje ten problem przez ciągłą regenerację zapytań z żywych źródeł. Zapytania dotyczące wiadomości są odświeżane co godzinę z RSS feedów i Google Trends, a zapytania z zakresu finansów, nauki, prawa i rzadkich bytów regenerowane są codziennie z SEC XBRL, arXiv, Europe PMC, CourtListener i publicznych logów agentów. Piętnaście różnych API wyszukiwarek testuje się równocześnie wobec tego samego tekstu zapytania, a każdy wynik porównuje się z ultimate - pooled oracle engine, który rejestruje wszystko, co znaleźć zdołał cały badany obszar. NEEDLE stoi za akronimem News, Everyday, Expert, Deep-tail and Legal Evaluation, reprezentując pięć różnych typów intencji użytkownika.

Benchmark dostępny jest jako narzędzie open source - Python CLI instalowany przez uv sync i sterowany dwoma podkomandam per benchmark: generate i run. Wymaga klucza OpenRouter do oceny i pojedynczych kluczy API dla każdego testowanego silnika. Działa zarówno na laptopie, jak i w systemach CI. Całość jest reproducible - użytkownicy mogą recreate wszystkie strumienie zapytań i judgment quality, co stanowi znaczący krok w kierunku uczciwej, ciągłej oceny możliwości wyszukiwania AI.