Naukowcy opublikowali badania dotyczące automatycznej klasyfikacji poufności dokumentów organizacyjnych, problemem, który ma rosnące znaczenie dla bezpieczeństwa i zgodności regulacyjnej firm. Błędna klasyfikacja może prowadzić do naruszeń przepisów lub wycieków danych, dlatego niezawodność systemów AI w tym obszarze jest kluczowa.

Hlavnym wkładem pracy jest dataset Strategic 16K - corpus 16 tysięcy depesz dyplomatycznych pochodzących z WikiLeaks Public Library of US Diplomacy. Naukowcy skupili się na krytycznym problemie zwanym label leakage, czyli sytuacji, gdy modele uczą się z przypadkowych znaków klasyfikacyjnych pozostawionych w tekście dokumentów, zamiast z ich rzeczywistej zawartości. Takie "skróty" prowadzą do zawyżonych ocen wydajności, które nie sprawdzają się w praktyce. Zespół opracował rozszerzony protokół usuwania wycieków, identyfikujący i eliminujący trzy kategorie takich zniaków.

W czystym benchmarku BERT wykazał najlepszą wydajność z dokładnością 89,14% i wynikiem F1 89,33%, a ELECTRA osiągnął 88,57% dokładności. Wśród klasycznych modeli TF-IDF połączony z logistic regression uzyskał najlepsze wyniki przy znacznie niższych wymogach obliczeniowych. To sugeruje, że dla wiele praktycznych zastosowań prostsze modele mogą oferować atrakcyjną alternatywę w stosunku do dużych transformerów, szczególnie kiedy zasoby są ograniczone.