Badacze opracowali metodę CoCo do interpretacji modeli nagród wykorzystujących architekturę Mixture-of-Experts, która głębiej wyjaśnia zachowanie poszczególnych ekspertów niż dotychczasowe podejścia. Problem polega na tym, że tradycyjne metody oparte na wagach routingu pokazują jedynie, które prompty trafiają do eksperta, ale nie ujawniają, jak ten ekspert ocenia odpowiedzi.

Metoda CoCo wykorzystuje pary odpowiedzi wybranych i odrzuconych z największym kontrastem wkładu, jednocześnie uwzględniając zarówno zachowanie routingu, jak i preferencje ekspertów. Ta kombinacja pozwala na bardziej dokładne zrozumienie specjalizacji każdego eksperta w ramach MoE. Zgodnie z badaniami, CoCo generuje bardziej spójne i godne wiary interpretacje niż konkurencyjne podejścia bazujące na routerze, ocenach lub rzadkich autoenkoderach.

Ważność tego badania tkwi w tym, że modele nagród są kluczowe dla uczenia się z preferencji człowieka, ale zrozumienie tego, co napędza ich predykcje, pozostawało trudne. CoCo stanowi pierwsze systematyczne studium metod interpretacji dla MoE reward models, otwierając drogę do większej przejrzystości w systemach uczenia się z feedback'u człowieka oraz potencjalnie poprawiając bezpieczeństwo i niezawodność AI.