Naukowcy z obszaru AI opracowali DEEPO (Dual-Entropy Enhanced Policy Optimization), metodę mającą na celu zmniejszenie halucynacji w multimodalnych modelach językowych poprzez ulepszenie procesu uczenia ze wzmacnianiem. Problem leży w dwóch słabych punktach tradycyjnego podejścia do korygowania błędów: na poziomie generowania próbek model często produkuje grupy jednomyślnie błędnych odpowiedzi dla trudnych zapytań, a na poziomie optymalizacji model nie potrafi efektywnie korygować błędów wykonywanych z wysoką pewnością.

DEEPO rozwiązuje te problemy dwustopniowo. Po pierwsze, system automatycznie wykrywa trudne zapytania oparte na wysokiej entropii semantycznej i wstrzykuje specjalne prefiksy generujące odpowiedzi ugruntowane w rzeczywistości. To przywraca informacyjność sygnału treningowego tam, gdzie tradycyjne metody zawodzą. Po drugie, stosuje prewarunkowanie gradientów uwzględniające znak przewagi i teorię Renyiego, co pozwala modelowi efektywnie uczyć się nawet z błędów, które przewiduje z wysoką pewnością.

Badania wykazały, że DEEPO osiąga znaczną poprawę na VideoMMMU, najzłożyczniejszym zadaniu długohoryzontalnym w zbiorze testowym, z przyrostem 4 punktów procentowych. Metoda może być szczególnie ważna dla aplikacji wymagających precyzji, takich jak systemy medyczne lub edukacyjne, gdzie halucynacje modelu stanowią poważny problem.