Badacze z arXiv opublikowali pracę dotyczącą wzmocnienia odporności algorytmu XGBoost na anomalnie w danych poprzez alternatywne funkcje straty. XGBoost jest jedną z najpopularniejszych metod do zadań predykcyjnych, a jego domyślne podejście polega na iteracyjnym dopasowywaniu prostych drzew decyzyjnych do reszt z poprzedniego kroku. Tradycyjnie stosuje się funkcję straty opartą na błędzie kwadratowym, czasami z dodatkiem funkcji Hubera, jednak badania wykazały, że to podejście może być wrażliwe na outliers pionowe i leverage points - punkty o dużej sile wpływu na model.

Zamiast standardowych podejść, zespół badaczy eksplorował alternative funkcje straty bazujące na M-, S- i tau-estimatorach pochodzących z dziedziny robust regression. Metody te są znane z naturalnej odporności na wartości anomalny, a ich zastosowanie w XBoostu pozwala na wbudowanie tej cechy bezpośrednio w proces uczenia. Szczególnie obiecująca okazała się procedura dwuetapowa zwana MM-XGBoost, której charakterystyczną cechą jest umiejętne zbilansowanie dwóch sprzecznych celów: zachowania odporności na szum i błędy w danych przy jednoczesnym utrzymaniu wysokiej dokładności predykcji.

Praca ma znaczenie praktyczne, ponieważ rzeczywiste zbiory danych zawierają błędy pomiaru, wartości anomalne i inne zniekształcenia, które mogą zaburzać działanie standardowych metod. Lepsze narzędzia do obsługi takich przypadków mogą zaowocować bardziej niezawodnymi modelami w produkcji, szczególnie w branżach gdzie czystość danych nie jest gwarantowana.