Zespół badawczy przedstawił nową skalowaną metodę oceny jakości danych treningowych dla modeli języka, która aproksymuje wartość Shapleya bez kosztownego iteracyjnego przekwalifikowywania modeli. Zamiast tego wykorzystuje probabilistyczne rozkłady referencyjnego LLM do bezpośredniej oceny wpływu każdego rekordu na przewidywania modelu poprzez zmianę log-likelihood w scenariuszach zero-shot i one-shot.

Algorytm mapuje semantyczne sąsiedztwa k-NN w skierowany graf, a następnie przekształca uzyskane wyniki w lokalne metryki przewagi, aby wyizolować rekordy powodujące konflikty gradientów. To podejście znacznie efektywniej niż tradycyjne metody, takie jak deduplicacja semantyczna czy LLM-as-a-judge, wychwytuje rzeczywisty wpływ danych na zachowanie modelu i ujawnia głębokie sprzeczności funkcjonalne w zbiorach danych.

Walor praktyczny metody potwierdza jej zastosowanie na rzeczywistych datasetach. Na HelpSteer2 automatyczna audytacja skurczyła przestrzeń poszukiwań błędów z milionów na kilka tysięcy rekordów, a następnie odkryła szereg nieprawidłowo etykietowanych przykładów. Na datasecie HH-RLHF Anthropica algorytm ujawnił tysiące ukrytych konfliktów bezpieczeństwa i odwrotności preferencji faktycznych, które mogły by pozostać niewykryte przy standardowych metodach. To jest szczególnie istotne, bo wzrost skali datasetów treningowych sprawia, że ręczny audyt staje się niemożliwy, a ukryte problemy coraz bardziej wpływają na wyrównanie modeli.