Naukowcy przeprowadzili szczegółową ocenę dwóch konkurencyjnych modeli System-1 służących do podejmowania szybkich decyzji w agentach AI. System-1 decision models - to sieci neuronowe działające w pojedynczym forward passie - mogą znacznie obniżyć koszty i opóźnienia w stosunku do pełnych wywołań dużych modeli językowych. W badaniu porównano open-weightowy model Laya z hostowanym modelem Jev na podstawie 7283 podstawowych przypadków testowych plus 6640 wariantów odporności, zapewniając byte-identical wejścia i powtarzalność testu.

Wyniki pokazały, że Jev osiągnął istotnie wyższą dokładność w 9 z 11 punktów decyzyjnych, z przyrostami od 10,8 do 46,0 punktu procentowego. Jednak model Laya wykazał poważne słabości - zmienił 30 procent odpowiedzi, gdy zmieniana była kolejność opcji, i drastycznie degradował się przy wielu podobnych kandydatach (31 procent dokładności przy 50 narzędziach vs 98 procent dla Jev). Żaden z modeli nie radził sobie lepiej niż przypadek przy rutingowaniu modeli bez treningu.

Najważniejsze odkrycie dotyczy błędów w samej metodologii oceny. Autorzy przeprowadzili autocrit własnego pipeline'u i znaleźli cztery znaczące problemy: pominięty koszt pre-screen (skośne oszczędności: 23,9 procent vs rzeczywiste 4,3 procent), raportowanie dokładności bramy jako jakości end-to-end (58 procent vs 98 procent), stosowanie progów wytrenowanych na zestawie treningowym (5 procent celu, do 17 procent błędów na holdoutcie), oraz efekt kanału wpływający na fałszywie pozytywne alarmy injections. Badanie podkreśla lukę między optymistycznymi twierdzeń a rzeczywistą wydajnością systemów decyzyjnych w praktyce.