Naukowcy z arXiv CS.AI opracowali testowe stanowisko Vibe Patenting do badania, jak dobrze modele językowe mogą pełnić rolę sędziego w procesie tworzenia projektów patentów przez agentów AI. System wykorzystuje osobno wołany LLM do oceny wygenerowanych dokumentów patentowych i dostarczania strukturyzowanego sprzężenia zwrotnego do iteracyjnego ulepszania.
Wyniki pokazują, że sprzężenie zwrotne od LLM-sędziego konsekwentnie poprawia ocenianą przez niego jakość patentów, podczas gdy rewizja bez tego wskazania osiąga plateau wydajności. Co ciekawe, iteracyjny proces pozwolił słabszym agentom zbliżyć się do wydajności znacznie droższych modeli o wyższych zdolnościach rozumowania. Wzmocnienie modeli bazowych i zwiększona moc obliczeniowa dla rozumowania generalnie poprawiały wyniki, a specjalistyczne przepływy pracy dodatkowo je wzmacniały.
Naukowcy zawalidowali sędziego-LLM poprzez porównanie z niezależną oceną profesjonalnego prawnika patentowego. Odkryli godną uwagi, ale silnie zależną od metryki zgodność między maszyną a człowiekiem oraz systematyczne różnice w kalibracji. To wskazuje, że modele mogą być przydatne jako sygnały optymalizacyjne dla złożonych profesjonalnych przepływów pracy, ale mają znaczące ograniczenia w całkowicie niezawodnej ocenie dokumentów wymagających głęboką wiedzę specjalistyczną.