Badacze opublikowali WuYuEval, nowy benchmark przeznaczony do kompleksowej oceny zdolności dużych modeli językowych w zarządzaniu odpadami stałymi. W przeciwieństwie do istniejących testów skupiających się na wiedzy ogólnej, ten benchmark uwzględnia rzeczywiste wyzwania zawodowe związane z ograniczeniami inżynieryjnymi, środowiskowymi i politycznymi. Benchmark składa się z dwóch modułów: Foundation Module z 4590 pytaniami zamkniętymi w sześciu typach zadań i ośmiu kategoriach domenowych oraz Expert Module z 247 otwartymi scenariuszami wymagającymi optymalizacji wielocelowej i projektowania systemów.

Testowanie 33 modeli ujawniło znaczące różnice w wydajności. Najlepszy model osiągnął 94,64 proc. dokładności w module podstawowym, ale średnia dokładność spadła z 84,14 proc. na łatwych pytaniach do zaledwie 42,50 proc. na trudnych. Największe problemy pojawily się w obliczeniach, projektowaniu eksperymentów, planowaniu urbanistycznym i otwartych zadaniach eksperckich. Badacze wprowadzili specjalny system oceniania - anchor-calibrated LLM-as-a-Judge w połączeniu z porównawczym rankingiem Elo.

Wyniki wskazują, że mody myślenia nastawione na rozumowanie (Thinking modes) poprawiają wyniki, ale tylko u modeli z dobrą bazową zdolnością i niekoniecznie u wszystkich. Benchmark ma znaczenie dla praktycznego wdrażania AI w branży gospodarki odpadami, gdzie błędy mogą mieć poważne konsekwencje środowiskowo-gospodarcze.