Zespół badaczy wprowadził nowy benchmark MERIT (Memory Evaluation for Realistic Instrumented Tasks), który zmienia sposób ewaluacji pamięci w agentach LLM - zamiast testować czy model potrafi odpowiedzieć na pytania o historię rozmowy, mierzy rzeczywisty wpływ zapamiętanych faktów na wykonywanie zadań z użyciem narzędzi. Standard wprowadza pełne rozliczenie kosztów każdej operacji pamięci, mierzonej zarówno w tokenach, jak i dolarach.
Badania przeprowadzono na 23440 episodach trzech agentów (GPT-4.1, Claude Haiku 4.5 i Claude Sonnet 5), które wykonywały zadania wymagające wykorzystania informacji z wcześniejszych epizodów. Wyniki ujawniają znaczące braki w obecnych podejściach: embedding retrieval osiąga dokładność między 30% a 95% w zależności od modelu, a nawet gdy fakt zostanie poprawnie pobrany, agent działa na tej podstawie tylko w 55% przypadków. Natomiast tradycyjne magazyny faktów (fact stores) i streszczanie przez LLM utrzymują spójność na poziomie 70-100%.
Badania dowodzą, że długoterminowa pamięć rzeczywiście poprawia sukces zadań - podnosi go z 0% (bezpamięciowy baseline) do 55-100% - ale implementacja ma kluczowe znaczenie. Hybrydowe podejścia łączące różne metody okazały się gorsze niż sama struktura fact store, co kwestionuje popularne założenia o synergii między retrieval a LLM summarization. Odkrycia mają praktyczne implikacje dla projektowania agentów AI, sugerując że proste, przewidywalne magazyny faktów są bardziej wiarygodne od sofistykowanych systemów retrieval przy podobnych kosztach.