Zespół naukowców opublikował obszerny przegląd badań nad agentami multimodalnymi (arXiv:2608.20379), który systematycznie analizuje jak integracja percepcji wizualnej, słuchowej i innych modalności zmienia sposób działania nowoczesnych agentów AI.

Agendy oparte na dużych modelach językowych (LLM) już osiągały zdolność do planowania i działania, ale dodanie multimodalnych modeli dużych języków (LMM) otwiera całkowicie nowe możliwości. Te systemy mogą teraz jednocześnie analizować tekst, obrazy, audio i wideo, co znacząco zbliża je do sposobu percepcji świata przez ludzi. Survey śledzi ewolucję od agentów skoncentrowanych na tekście do pełnoprawnych systemów multimodalnych, badając różne podejścia architektoniczne - od delegowania przetwarzania różnych modalności do późnej fuzji danych w ostatnich warstwach sieci, aż po wczesną integrację informacji z różnych źródeł.

Badacze organizują swoją pracę wokół osi modalności, łącząc wybory architektoniczne z rzeczywistymi możliwościami agentów. Przegląd obejmuje wiele praktycznych zastosowań: robotykę, która wymaga zrozumienia scen 3D, nawigację interfejsów webowych i GUI, generowanie oraz edycję zawartości multimedialnej, a także analizę i wyszukiwanie w długich filmach wideo. To ma ważne znaczenie dla rozwoju AGI, bo pokazuje jak multimodalność staje się kluczowa dla budowania agentów o rzeczywistej użyteczności w świecie fizycznym i cyfrowym.