Naukowcy opracowali framework do detekcji mowy nienawiści, który łączy DistilBERT, model BiLSTM oraz mechanizm attention, osiągając F1-scores na poziomie 96,78% na zbiorze Davidsona i 99,53% na SMHS dataset. System obsługuje zarówno klasyfikację binarną jak i wieloklasową, co czyni go bardziej uniwersalnym niż dotychczasowe rozwiązania.

Mowy nienawiści w mediach społecznościowych stanowią poważne zagrożenie dla harmonii społecznej, zdrowia psychicznego użytkowników i bezpieczeństwa publicznego. Dotychczasowe badania skupiały się głównie na klasyfikacji binarnej, były testowane na pojedynczych zbiorach danych i oferowały ograniczony wgląd w mechanizmy podejmowania decyzji przez modele. To ograniczało ich praktyczne zastosowanie w rzeczywistych systemach moderacji treści.

Propozycja naukowców wyróżnia się na tle istniejących podejść poprzez integrację trzech kluczowych elementów: embeddings DistilBERT do reprezentacji tekstu, BiLSTM do przechwytywania zależności sekwencyjnych oraz mechanizmu attention. Kluczową innowacją jest zastosowanie LIME - Local Interpretable Model-agnostic Explanations - do wyjaśniania predykcji modelu przez wskazanie wpływowych cech tekstowych. Takie podejście zwiększa przejrzystość i zaufanie do systemu. Badacze przeprowadzili również ablation study, aby wykazać znaczenie poszczególnych komponentów frameworka.