Nowe badanie z arXiv pokazuje, że zwiększenie mocy obliczeniowej dla modelu sędziego nie zawsze poprawia jakość jego decyzji, szczególnie gdy musi on jednocześnie wydać wiele orzedzeń. W doświadczeniach obejmujących prace badawcze, dokumenty prawne i oceny prób klinicznych, naukowcy zaobserwowali, że gdy liczba wymagań do sprawdzenia rośnie, zgodność z opiniami ekspertów spada - niektóre decyzje stają się niedostatecznie uzasadnione w dostępnych dowodach.

Rozwiązanie stanowi metoda zwana shardingiem. Zamiast zlecać modelowi sprawdzenie wszystkich wymogów jednocześnie, wymogi dzieli się na mniejsze grupy i przydzieluje je osobnym wywołaniom modelu. Verdykty z każdego wywołania są następnie agregowane w końcową decyzję. To podejście przy zachowaniu tej samej całkowitej budżetu tokenów i tego samego budżetu na pojedynczą decyzję poprawia wydajność.

Badacze wykazali, że słabszy model sędziego z shardingiem może dorównać lub przewyższyć silniejszy model pracujący holistycznie. Sharding wykazuje też zdumiewającą odporność na ataki. Adversarze mogą wariować tylko prezentację pracy, nie zmieniając jej treści, aby zwiększyć akceptację niespełnionych wymogów przez przeciążony model. Jednak gdzie sharding zmniejsza błędy bazowe, całkowicie eliminuje tę lukę bezpieczeństwa, utrzymując niski wskaźnik fałszywych akceptacji nawet gdy ataki stają się bardziej zaawansowane.