Zespół badawczy opublikował AgentMemBench - pierwszy systematyczny benchmark oceniający pięć konkurencyjnych strategii zarządzania pamięcią długoterminową w agentach konwersacyjnych. Porównane podejścia to: in-context windowing (ICW), które przechowuje tylko ostatnie wymieniane fragmenty, zewnętrzne magazyny klucz-wartość (EKV), pamięć episodyczną opartą na grafach (GEM), kompresję poprzez podsumowanie (CBS) i pamięć wspomaganą siecią (WAM). Wszystkie strategie zweryfikowano na trzech publicznych zbiorach danych obejmujących wielosesyjne dialogi, orientowane na zadania dokumenty oraz rozmowy ugruntowane w personach, przy użyciu modelu Qwen2.5-7B-Instruct.
Wyniki okazały się zaskakująco jednoznaczne: zewnętrzne magazyny klucz-wartość dominują we wszystkich wymiarach jakości, osiągając Recall@5 na poziomie 0.792 oraz score wierności 0.354. Kluczowe odkrycie dotyczy przywracania informacji sprzed wielu sesji - na zestawie LoCoMo, gdzie pytania dotyczą zdarzeń z odległej przeszłości, metody ICW, WAM, GEM i CBS praktycznie całkowicie zawodzą z Recall@5 poniżej 0.005, podczas gdy EKV samodzielnie osiąga 0.573. To pokazuje, że podejścia oparte na oknach czasowych, podsumowaniach i grafach relacji załamują się przy długoterminowych zależnościach.
Wyniki mają istotne implikacje dla praktyki. Oznaczają one, że agenci konwersacyjni wymagający pamiętania informacji z poprzednich rozmów muszą polegać na gęstym retrievalu z zewnętrznych baz danych, a nie na tradycyjnych metodach kompresji czy lokalizacji. Badanie dostarcza też wiarygodnej metodologii - wykorzystując tę samą konfigurację dla wszystkich podejść i 491 testowych pytań - którą mogą przyjąć inni badacze pracujący nad ulepszaniem pamięci agentów AI.