Naukowcy z arXiv dowiedzli, że usuwanie słów stopu z tekstów prawniczych obniża dokładność klasyfikacji zamiast ją wspierać. W badaniu porównano wydajność algorytmów analizujących orzeczenia Sądu Najwyższego USA na dwóch zadaniach: określeniu ideologicznego kierunku wyroku (F1 około 0,68) i klasyfikacji typu sprawy jako konstytucyjnej lub nie (F1około 0,92). Dla każdego zadania badacze testowali usunięcie każdego ze 18,5 tysiąca kandydujących słów i mierzyli wpływ na dokładność modelu.

Wynikalembądania są zaskakujące: wszystkie powszechnie używane generyczne listy słów stopu spadały poniżej wyniku bez żadnych usunięć. Nawet zoptymalizowane listy, teoretycznie dostrojone do maksimalnej wydajności, nie dawały statystycznie istotnie lepszych wyników niż rezygnacja z usuwania czegokolwiek. To burzył powszechne przekonanie w informatyce, że eliminacja częstych, pozornie mało informatywnych wyrazów zawsze poprawia klasyfikację tekstu.

Probltem jest historyczne dziedzictwo. Preprocessing pipeline oparty na usuwaniu słów stopu pochodzi z czasów informatyki z połowy XX wieku, kiedy radzono sobie z ograniczeniami pamięci i mocy obliczeniowej. Nigdy jednak nie został walidowany wobec rzeczywistych metryk wydajności klasyfikacji, a mimo to stał się standardem w szkolnictwie i praktyce badawczej. Niniejsza analiza sugeruje, że empiryczne badania prawnicze traktujące tekst orzedzeń jako dane powinny przeformułować swoje preprocessing pipeline, szczególnie gdy tekstowe cechy są przedmiotem badania, a nie jedynie środkiem do prognozowania.