CaM-Wolf to pierwszy agent AI dla gier dedukcji społecznej, który łączy percepcję i generowanie wielomodalne zamiast ograniczać się do tekstu. Agent przetwarza wideo wejściowe od innych graczy, a następnie stosuje przyczynowo-świadomy reasoner trenowany metodą reinforcement learning, aby nawiązać logiczne powiązania między obserwowanymi zachowaniami a ukrytymi rolami w grze. Całość komunikacji odbywa się poprzez animowaną awatarę, co daje bardziej naturalny sposób interakcji niż tradycyjne wyłącznie tekstowe podejścia.
Gry dedukcji społecznej takie jak Werewolf stanowią wciąż zaawansowany test dla zdolności AI, wymagając kompleksowych umiejętności społecznych obejmujących rozumowanie, zdolność do oszukiwania i współpracę. Do tej pory rozwój agentów do takich gier opierał się głównie na dużych modelach językowych operujących tekstem, co ignorowało wielomodalną naturę rzeczywistych interakcji społecznych człowieka. Ta luka między tekstem a rzeczywistością jest znacząca - osoby w grze nie tylko mówią, ale również wykonują gesty, wyrażają emocje twarzą i wysyłają niezliczone niewerbalnych sygnały.
Experymenty i badania user study pokazują, że CaM-Wolf uzyskuje wyższą wydajność w samej grze oraz znacząco podnosi jakość interakcji między ludźmi a agentem. Ten wynik sugeruje, że integracja wielomodalnych wejść i wyjść stanowi kluczowy krok w kierunku tworzenia bardziej naturalnych i społecznie inteligentnych agentów AI. Badacze udostępnili kod projektu, otwierając drogę do dalszych badań nad wielomodalnymi agentami zdolnymi do uczestniczenia w niuansowych dynamikach społecznych.