Naukowcy z arXiv zaproponowali nowy framework o nazwie Active Perception for Embodied Disambiguation, który pozwala robotom samodzielnie rozwiązywać niejasności w poleceniach wydawanych w języku naturalnym. Problem polega na tym, że dwuznaczność nie wynika tylko z niejaśnych poleceń użytkownika - czasami robot po prostu nie widzi wszystkich istotnych detali ze względu na zasłonięte obiekty, ograniczony kąt widzenia, nieczytelne etykiety lub brakujące informacje.

Istotną różnicą wobec dotychczasowych metod jest to, że zamiast zawsze pytać użytkownika o wyjaśnienie, robot aktywnie zmienia swoją pozycję i obserwacyjny punkt widzenia. To działanie fizyczne w otoczeniu pozwala mu odkryć zasłonięte obiekty, przeczytać ukryte etykiety lub zobaczyć atrybuty semantyczne rzeczy, które były wcześniej niewidoczne. Framework wykorzystuje vision-language model, aby na podstawie zgromadzonych dowodów wizualnych i informacji z interakcji z użytkownikiem podjąć decyzję - czy kontynuować obserwację, poprosić o wyjaśnienie, czy już dokonać wyboru celu.

Experymenty na rzeczywistych robotach wykazały, że proponowane podejście efektywnie integruje zdobywanie informacji fizycznych z przechwytywaniem intencji użytkownika w jednolitym procesie. To ważne dla praktycznego zastosowania robotów w rzeczywistych środowiskach, gdzie naturalne polecenia mogą być wieloznaczne, a dostępne informacje sensoryczne mogą być niekompletne. Framework stanowi krok w kierunku bardziej autonomicznych robotów, które samodzielnie rozwiązują niejasności zamiast polegać wyłącznie na dodatkowych informacjach od człowieka.