Zespół naukowców przeprowadził audyt swojego produkcyjnego pipeline'u text-to-SQL, który polegał na wdrożonym modelu gpt-4o-mini pełniącym rolę sędziego do weryfikacji poprawności SQL-i generowanych z zapytań tekstowych. Odkryli szokujący brak zgodności - model zgadzał się z dwoma niezależnymi adnotatorami ludzkimi zaledwie na poziomie Cohen's kappa = 0,04 na zbiorze wzbogaconym o przypadki sporu i 0,42 na równomiernym spotchecku. Główny problem stanowił niski recall - model niepotrzebnie flagował 77,1% poprawnych przypadków SQL-i wygenerowanych przez ludzi.
Analiza przyczyn ujawniła, że większość błędnych flagowań wynikała z jednego mechanizmu, który autorzy nazwali GRADE-HALLUCINATION. Polegał on na tym, że model całkowicie hallucynował błędy w kodzie, które w rzeczywistości nie istniały. Zamiast tego zespół przetestował możliwość zamiany modelu na lokalnie hostowany Qwen3.6-27B, uzyskując kappa = 0,72, czyli poziom porównywalny z Claude Opus o wyniku 0,71. Jednak przełom polegał na aspekcie ekonomicznym - Qwen był około 300 razy tańszy w użytkowaniu, co przy produkcyjnej skali stało się decydujące.
Dalsza eksperymentacja pokazała, że prosty ensemble słabego sędziego z silnym faktycznie pogorszył wyniki. Natomiast trzy silne modele pracujące razem pod wymogiem unanimity routing (wszystkie musiały się zgodzić) osiągnęły kappa = 0,79 przy 89,7% automatycznego pokrycia - praktycznie użytecznym wyniku bez konieczności ręcznego przeglądu. Audyt zastosowany na obcym zbiorze danych BIRD-financial zidentyfikował problemy w 25,5% золота-standardu SQL-i stworzonego przez ekspertów, sugerując że problem był bardziej systemowy.