Zespół badaczy zaprezentował Expert-validated STEM QA, nowy wysokiej jakości zestaw danych obejmujący 398 pytań z czterech kluczowych dziedzin nauki: fizyki, chemii, biologii i matematyki. Dataset utworzyli 241 ekspertów domenowych, którzy dbali o rzetelność każdej pozycji od momentu propozycji aż do ostatecznej walidacji.
Nowy dataset odpowiada na szereg problemów, które trapią istniejące zbiory danych do oceny modeli AI. Jednym z kluczowych wyzwań jest nasycenie wydajności - modele frontier tak dobrze radzą sobie na starych datasetach, że nie ma już miejsca na znaczące ulepszenia czy sensowną ocenę postępu. Projekt zwraca też uwagę na skośne rozkłady taksonomii, czyli niewyważony udział różnych typów pytań. Ponadto tradycyjny format wielokrotnego wyboru nie odpowiada rzeczywistym scenariuszom, w których naukowcy wykorzystują AI do pracy naukowej.
Badacze opracowali metodologię z kilkoma warstwami kontroli jakości: od starannie zaprojektowanej taksonomii z zbalansowanym rozkładem, przez weryfikację autorów pytań z systemem motywacyjnym nastawiony na jakość, aż do wielokrotnych rund recenzji z rewizjami zatwierdzanymi przez ekspertów na podstawie konsensusu. Wszystko to zmienia się w weryfikowalny format pytań i odpowiedzi, a nie tradycyjny wielokrotny wybór, co czyni dataset bardziej praktycznym dla rzeczywistych aplikacji naukowych.