BudgetBench to nowy protokół i narzędzie do porównywania różnych strategii zarządzania pamięcią w lokalnie uruchamianych dużych modelach języka. Kluczowy problem, który rozwiązuje, to fakt, że dla agentów pracujących lokalnie kontekst aktywny jest zasobem deficytowym - pojemność pamięci, opóźnienia prefill, wzrost cache'u i cele operacyjne ograniczają, ile tokenów model może przetwarzać na jedno wejście.
Głównym wkładem pracy jest reusable powierzchnia pomiarowa zbudowana wokół swappable MemoryStrategy - interfejsu pozwalającego testować różne strategie zarządzania pamięcią. BudgetBench systematycznie zmienia budżet tokenów (2K, 4K, 8K, 16K, 32K) i dla każdego pomiaru rejestruje jakość odpowiedzi, efektywność wykorzystania budżetu, opóźnienia oraz - po raz pierwszy traktowane jako first-class outcome - wskaźnik naruszeń limitu budżetu. Wszystko to przy stałym modelu, zadaniu, samplerze i strategii dekodowania.
Pilotażowe badania na modelach qwen2.5:1.5b (89 elementów SWE-bench Verified i LongBench v2), hostowanym Qwen3 30B (50 elementów LongBench) i 500-elementowym LongMemEval z ewaluacją GPT-4o ujawniły, że tradycyjne testy z jednym budżetem mogą maskować krytyczne problemy - od braku zgodności z limitami po niemonotoniczną zmianę jakości przy zwiększeniu budżetu. Narzędzie zostało udostępnione na GitHub z pełną dokumentacją do reprodukcji wyników.