vLLM Semantic Router zaprezentował Decision 3.0 - rodzinę otwartych multimodalnych modeli decyzyjnych, które zamiast generować tekst zwracają kalibrowane prawdopodobieństwa dla odpowiedzi. Modele obsługują tekst, JSON i obrazy, a pytania mogą być pytaniami wielokrotnego wyboru, binarnymi (Tak/Nie) lub skalami ocen. Wszystkie odpowiedzi generowane są w jednym wywołaniu, co czyni to idealnym rozwiązaniem dla systemów routingu i guardrailów.

Decision 3.0 obejmuje pięć wariantów: d3-lite (0.85B), d3-nano (2.21B), d3-mini (4.54B), d3-flash (8.39B) i d3 (26.09B parametrów). Wszystkie modele są fine-tuningami bazy Qwen i dostępne na licencji Apache-2.0, co oznacza pełną otwartość i możliwość komercyjnego zastosowania. Testy wydajności pokazują, że najmniejszy model 9B osiąga lepsze wyniki niż poprzednia generacja modelu 27B. Najlepszy rezultat to 97.7 punktu w zadaniu ekstrakcji danych z dokumentów (KIE na zbiorach CORD i FUNSD).

Zasadnicza różnica w stosunku do tradycyjnych podejść polega na tym, że zamiast promptować dużego modelu językowego i parsować jego tekstową odpowiedź, dostajemy bezpośrednio skalibrowane i progowe wartości prawdopodobieństwa. To eliminuje problemy z parsingiem, zmniejsza opóźnienia i obniża koszty obliczeniowe. Modele działają na architekturze BF16 bez oficjalnie udostępnionych wersji skwantyzowanych.