Naukowcy z arXiv opracowali audytowalną warstwę korekcji ortograficznej dla systemów przetwarzania naturalnego języka w medycynie, która bezpiecznie naprawia artefakty pochodzące z automatycznego parsowania dokumentów PDF. System działa jako konserwatywny moduł przetwarzania wstępnego, który zamiast maksymalizować dokładność, kieruje się zasadą "nie szkodzić" - w sytuacjach niepewności wstrzymuje się od edycji tekstu.

Problema polega na tym, że wielkie korpusy tekstów biomedycznych często zawierają błędy OCR-owe, uszkodzenia na poziomie znaków, błędne łączenie i dzielenie tokenów oraz pozostałości łączników. Te zniekształcenia systematycznie osłabiają wiarygodność danych lexykalnych i pogorszają działanie klasyfikatorów naukowych. Architektura zaproponowanego systemu łączy generowanie kandydatów do korekty w ograniczonej odległości edycji z punktowaniem opartym na n-gramach z korpusu oraz specjalnymi "wrotami bezpieczeństwa" chroniącymi kluczową terminologię biomedyczną.

W testach przeprowadzonych na 2104 przypadkach tokenów oraz klasyfikatorze CORD-19 (rozróżniającym tematy: Profilaktyka, Leczenie, Epidemiologia) na 10 tysięczach przykładów system uzyskał 94,61% skuteczności w naprawie błędów bez wprowadzenia szkodliwych zmian. Na poziomie całego pipelineów klasyfikacyjnych udało się odzyskać około 80,45% wydajności utraconej przez szumy, podnosząc makro-F1 z 0,7654 do 0,7717 przy jednoczesnym zachowaniu blisko czystej wydajności (0,7721).