Mistral AI wydał Shieldstral 1.0 3B, otwarty model klasifikacji bezpieczeństwa treści, który zamiast sztywnej kategoryzacji ryzyka posługuje się pojedynczym pytaniem polityki sformułowanym w naturalnym języku. Operator definiuje warunki bezpieczeństwa przy uruchomieniu, a model zwraca skalibrowany wynik ryzyka w jednym przebiegu sieci - ten geniusz leży w adaptacyjności: ta sama treść może być bezpieczna w narzędziu do badań cybersecurity, a szkodliwa na platformie zdrowia psychicznego.

Model zbudowany na architekturze Ministral-3-3B-Base-2512 z wbudowanym enkodem widzenia Pixtral wykazuje imponujące wyniki - 84,9% średniego F1 dla bezpieczeństwa tekstu (dorównując GPT-OSS-Safeguard-20B, modelowi 7 razy większemu) oraz 83,8% dla treści multimedialnych, przewyższając wszystkie oceniane przez Mistral baseline'i. Liczby te znaczą tyle, że mały model z 3 miliardami parametrów konkuruje z modelami dziesięciokrotnie większymi.

Z praktycznego punktu widzenia Shieldstral jest już deployowalny - mieści się w 16GB VRAM w formacie BF16, a infrastruktura go obsługuje: vLLM, llama.cpp z konwersją GGUF, SGLang i Transformers. Model emituje tylko jeden token, co oznacza ekstremalnie niskie opóźnienia i koszty względem rozwiązań opartych na reasoning. Licencja Apache 2.0 umożliwia zarówno użytek komercyjny, jak i niekomercyjny, co otwiera drzwi dla startupów i małych zespołów AI, dla których 16GB VRAM jest osiągalne.