ViSAGE to nowy framework dla agentów multimodalnych, który rozwiązuje fundamentalny problem w analizie długich nagrań wideo - utratę pamięci o tym, kto jest kto. Gdy obecne systemy kompresują dane z wideo, tracą szczegółowe informacje tożsamości postaci, co prowadzi do pomyłek i błędnych odpowiedzi. ViSAGE pracuje inaczej - buduje pamięć skoncentrowaną na tożsamości jednostek poprzez powiązanie danych z różnych źródeł (obraz, tekst, dźwięk) w długim przedziale czasowym.
Klucz do sukcesu leży w dwukierunkowej kalibracji pamięci. System nie tylko przechowuje informacje o tym, co się dzieje, ale też retrospektywnie je poprawia, gdy pojawiają się nowe dowody tożsamości. Jeśli na przykład w scenie 50 pojawia się potwierdzenie tożsamości kogoś, kto pojawił się już w scenie 10, ViSAGE wychodzi wstecz i ujednocaca te rekordy. Dodatkowym mechanizmem bezpieczeństwa jest weryfikacja krzyżowa między wieloma agentami - system sprawdza, czy pobrane dowody rzeczywiście pasują do tożsamości, a jeśli nie są pewne, odmawia odpowiadania zamiast wymyślać.
W testach ViSAGE osiąga 5,9% wyższą dokładność niż dotychczasowe najlepsze rozwiązania. To jest istotne dla systemów AI mających analizować długie dokumenty wideo, gdzie tradycyjne podejście oparte na podobieństwie wektorowym często łączy postacie z tego samego powodu, ale błędnie - na przykład uznaje drugą blondynkę za tę samą postać co pierwsza, mimo że to różne osoby.