Badacze z arXiv opublikowali nową metodę do przewidywania bankructwa firm, która łączy konsensualną selekcję cech, hybrydowy resampling i ensemble stackingu. System trenowano na taiwanese dataset zawierającym informacje finansowe z repozytorium UCI Machine Learning. Po zastosowaniu pięciu algorytmów selekcji cech zredukowano liczbę zmiennych do 23 najbardziej niezawodnych, co znacznie upraszcza model i zmniejsza szum.
W badaniu porównano pięć klasyfikatorów machine learning (gradient boosting, extreme gradient boosting, histogram-based gradient boosting, LightGBM i AdaBoost) z pięcioma modelami deep learning (RNN, LSTM, GRU, DNN i MLP). Kluczowe było zastosowanie hybrydowych technik resamplingu: SVM-SMOTE, SMOTE-Tomek i SMOTE-ENN, które pomagają rozwiązać problem niezrównoważonych danych finansowych, gdzie bankructwa są rzadkie. Hybrydowe stackingi łączyły modele machine learning jako podstawowe learners z modelami deep learning jako meta-learnerami.
Wyniki pokazały, że strategia resamplingu ma kluczowe znaczenie dla wydajności. SVM-SMOTE i SMOTE-Tomek osiągnęły wyższą dokładność i specyficzność, natomiast SMOTE-ENN lepiej wykrywała przypadki bankructwa w mniejszościowej klasie. Model GRU z SMOTE-ENN zapewnił najlepszą równowagę z recall 0.8627 i G-mean 0.8627. Dla wyjaśniania ważności cech wykorzystano SHAP, co pozwala instytucjom finansowym zrozumieć, które zmienne finansowe mają największy wpływ na decyzje o ryzyku bankructwa.