Naukowcy z branży zaproponowali ESQ-Bench - pierwszy benchmark NL2SQL oparty na Oracle'u, który odpowiada rzeczywistej złożoności korporacyjnych baz danych. Podczas gdy popularne benchmarki Spider i BIRD osiągają wyniki powyżej 89 procent dokładności, nowe narzędzie pokazuje, że obecne modele walczą z naprawdę skomplikowanymi schematami przedsiębiorstw.
Esq-Bench zawiera sześć kompleksowych schematów z łącznie 465 tabelami i 164 682 wierszami danych, które zostały zsynchronizowane na czterech platformach SQL - Oracle, PostgreSQL, MySQL i SQL Server. Badacze przygotowali 550 ręcznie zweryfikowanych par pytania-zapytania SQL rozmieszczonych na trzech poziomach złożoności. Kluczową innowacją jest ocena "silent divergence" - zjawiska, gdy model generuje zapytanie technalnie wykonalne, ale zwracające błędne wyniki ze względu na błędy semantyczne.
Wyniki testów są rozjuszające dla entuzjastów AI. GPT-4o z promptingiem schema-linked wykazuje monotoniczny spadek - od 79,8 procent dokładności na Tier-1, przez 60,3 procent na Tier-2, do zaledwie 57,2 procent na Tier-3. Jeszcze bardziej niepokojące - nawet zapytania, które zostały poprawnie wykonane, zawierają błędy semantyczne w 73-99 procentach przypadków. Claude Sonnet 4.6 osiąga lepsze wyniki: 87,4 procent na Tier-1, 74,9 procent na Tier-2 i 68,7 procent na Tier-3, co daje mu wyraźną przewagę nad GPT-4o. Benchmark odsłania, że prawdziwy problem tkwi nie tylko w generowaniu SQL, ale w zrozumieniu zawiłych semantyk biznesowych.