Badacze z arXiv zaprezentowali CapMem, nowy benchmark oceniający jak dobrze modele AI potrafią pracować z pamięcią epizodyczną na podstawie tekstowych podpisów do egocentrycznego wideo. Problem jest praktyczny: noszone asystenty muszą pamiętać długie nagrania z kamer pierwszej osoby, ale obecne modele wizyjno-językowe borykają się z ograniczonymi budżetami ramek, rosnącymi kosztami tokenów wizyjnych i porażkami w retrievalu na długim kontekście.
Benchmark zawiera 75 nagrań wideo o łącznej długości 33,7 godzin w 16 różnych scenariuszach, wraz z 1000 pytań w formacie wielokrotnego wyboru. Kluczowe odkrycie: na długich wideo powyżej 20 minut, pełna analiza podpisów generowanych co 30 lub 60 sekund okazała się lepsza niż bezpośrednia analiza całego wideo dla 10 na 12 oraz 8 na 12 testowanych modeli. Przy kontrolowaniu liczby przeglądanych klatek w modelach Qwen przychody z dodatkowych podpisów wyniosły średnio 3,22 i 2,55 punktu dokładności. System retrieve-and-verify oparty na prowadzeniu podpisów poprawiał wyniki o aż 5,3 punktu.
Wyniki sugerują, że tekstowe podpisy mogą być pragmatyczną alternatywą dla wideo w systemach pamięci. Zamiast przechowywać i przetwarzać każdy pixel, asystent może táć na przypomnieniach w postaci tekstu - znacznie efektywniej, taniej i bardziej skalowalne dla praktycznych aplikacji wearable'owych pracujących z godzinami nagrań dziennie.