Semalith v1.4 to nowy klasyfikator bezpieczeństwa zbudowany na bazie DeBERTa-v3-base, który w jednym przebiegu wykonuje trójwymiarową klasyfikację bezpieczeństwa obejmującą detekcję prompt injection, ogólne szkody i zgodność z regulacjami sektora finansowego. Model posiada 22-klasową głowę decyzyjną rozpoznającą komunikaty benignne, dziewięć podtypów prompt injection, ogólne zagrożenia oraz jedenaście etykiet dla sektora finansowego i usług bankowych (BFSI). Został wytrenowany na korpusie 76204 próbek zebranych z 49 publicznych źródeł z deduplikacją, gdzie 21 z 22 benchmarków osiągnęło zerową kontaminację danych testowych.
W bezpośrednim porównaniu z Llama-Guard-3-8B na 22 benchmarkach trzymanych jako test, Semalith v1.4 wygrywa wszystkie ewaluacje prompt injection (7 z 7) oraz 11 z 18 testów ogółem, używając zaledwie 184 milionów parametrów wobec 8 miliardów parametrów konkurenta. Szczególnie imponujący jest wynik na benignnych promptach agentowych: model osiąga zero false positive rate, podczas gdy Llama-Guard-3 ma 0.063. Autorzy честnie ujawniają, że na benchmarkach ogólnych harm (WildGuardMix, HEx-PHI, HarmBench) Llama-Guard-3 prowadzi, ale podkreślają komplementarny podział między modelami - Semalith specjalizuje się w injection attacks i compliance finansowy.
Wynik ma znaczenie praktyczne dla wdrażania LLM w instytucjach finansowych i systemach agentowych, gdzie konieczne jest jednoczesne sprawdzenie wielu aspektów bezpieczeństwa. Kompaktowy rozmiar modelu (184M vs 8B parametrów) oznacza znacznie szybszą i tańszą inferencję, co czyni go bardziej dostępnym dla mniejszych organizacji. Autorzy rekomendują v1.3 do moderacji konwersacyjnej, a v1.4 gdy wymagane jest zerowe false positive lub pełne pokrycie etykiet BFSI.