Naukowcy zaprezentowali DataPrep-Bench, pierwszy ujednolicony benchmark do kompleksowej oceny zdolności LLM-ów, agentów i workflows zorientowanych na dane do przygotowywania danych treningowych od początku do końca. Problem stanowi fakt, że choć jakość danych treningowych fundamentalnie determinuje możliwości dużych modeli językowych, brakuje narzędzi do systematycznego pomiaru wydajności metod przygotowania danych.

Benchmark ocenia dwie komplementarne umiejętności: data construction (transformacja surowych źródeł w dane treningowe) i data quality evaluation (predykcja wartości treningowej potencjalnych zbiorów danych). Zespół badaczy zdefiniował jakość nie jako powierzchniowe właściwości tekstowe, ale jako faktyczną użyteczność treningową dla modeli. DataPrep-Bench obejmuje sześć domen i jest testowany na wielu modelach bazowych, gdzie ewaluacja odbywa się poprzez fine-tuning na wspólnym protocol gruntowanym w rzeczywistych zadaniach downstream.

W ramach projektu zespół opracował Data-Construction-Skill, agenta wspomaganego instrukcjami, który osiąga prawie 20 punktów poprawy względem samego Dolly-15k dla Llama-3.1-8B w domenie finansowej i pozostaje konkurencyjny wobec najlepszych metod opartych na agentach i DataFlow. Dodatkowo zostały udostępnione Distributional Alignment Score, funkcja oceniająca oparta na analizie rozkładów danych, która koreluje z rzeczywistą wydajnością downstream. Ten benchmark ma potencjał stać się standardem dla całej branży w ocenie i optymalizacji pipeline-ów przygotowania danych do treningu modeli.