Cantina Security wydała apex-flash-1, otwarty model bezpieczeństwa ze 321.3 miliardami parametrów, który w testach rozwiązał 40 z 60 held-out zadań badawczych z rzeczywistych podatności. Model jest fine-tuned przez reinforcement learning oparty na GLM-5.3-Flash od Z.ai, z dodatkowaniem rangi-256 LoRA i selektywnym treningiem pełnych parametrów. Wdrożony na Hugging Face pod licencją MIT, może działać na vLLM, SGLang lub Transformers, choć wersja BF16 wymaga około 640 GB pamięci GPU.

Zasób treningowy obejmował 150 zadań zbudowanych z 50 rzeczywistych przypadków podatności, każdy w trzech wariantach: guided whitebox, focused whitebox i focused blackbox. Błędy autoryzacji, identyfikacji i zakresu stanowiły 72 procent przypadków, buggi rachunkowe i precyzji numerycznej 18 procent, pozostałe obejmowały walidację czasu, reguły biznesowe i SSRF. Rollout-y reinforcement learning odbywały się w harnesie Codex agent na środowiskach przypominających produkcyjne.

apex-flash-1 osiągnął 66,7 procent sukcesu przy koszcie około 2,38 dolara na uruchomienie, podczas gdy Claude Opus 5 High osiągnął 71,7 procent za 74,68 dolara - około 31 razy więcej. Bazowy GLM-5.3-Flash znalazł rozwiązanie dla 60 procent zadań za 4,56 dolara. Wynik pokazuje, że specjalistyczne modele open-source mogą konkurować z proprietarnymi rozwiązaniami w niszowych obszarach badań bezpieczeństwa przy znacznie niższych kosztach.