Zespół naukowców opracował DataKernelBench - pierwszy benchmark specjalistycznie mierzący zdolność dużych modeli jezyka do optymalizacji zapytań bazodanowych na GPU. Narzędzie przekształca zapytania SQL w programy PyTorch TorchPlan i ocenia, czy modele potrafią zoptymalizować zarówno pojedyncze operacje jądra, jak i całe zapytania, napisane w CUDA lub Triton. W testach na dziesięciu modelach (zarówno własnościowych, jak i open-source) przy użyciu GPU H100, najlepsze konfiguracje osiągnęły przyspieszenie 2,11x w stosunku do torch.compile dla pełnych zapytań z 100-procentową skutecznością.
Dotychczasowe benchmarki dla modeli LLM skupiały się na operatorach uczenia maszynowego, a bazy danych pozostały niedostatecznie zbadane. Badania wykazały, że lepiej działające implementacje regularnie używają fuzji kerneli oraz zmian strategii wykonania. Interesujące odkrycie to fakt, że kontekst obciążenia (rodzaj zadania) okazał się ważniejszy niż kontekst sprzętu przy optymalizacji.
Kiedy naukowcy rozszerzyli framework o obsługę danych większych niż pojemność GPU, integrując Dask-cuDF do dynamicznego ładowania partycji, osiągnęli przyspieszenie 2,54x na testach TPC-H SF100 z czterema GPU H100. Oznacza to, że modele AI mogą efektywnie optymalizować rzeczywiste, skalowalne obciążenia bazodanowe, co ma potencjał do znacznego przyspieszenia hybrydowych systemów baz danych obsługujących akceleratory GPU.