Fathom to innowacyjna metoda skanowania klucza w attention mechanism, která adresuje wąskie gardło w wydajności dużych modeli języka obsługujących długie sesje. Kiedy agencie sesje rosną do miliona tokenów z wieloma sesjami w pamięci hosta, koszt skanowania wszystkich n kluczy dla kroku top-k decoding staje się главным bottleneckiem. Fathom rozwiązuje ten problem, pozwalając każdemu query dynamicznie wybierać, ile bitów czytać z każdego kanału klucza - zamiast czytać wszystkie bity, query budżetuje czytanie bitów metodą reverse water-filling oprtą na wariancji i ważności kanałów.

Metoda przechowuje 4-bitowy cache kluczy w formacie bit planes, gdzie prefix t płaszczyzn reprezentuje dokładnie t-bitowy kwantyzator kanału. Na benchmarkach z milionem tokenów na Qwen3-8B Fathom jest 1,67 razy szybszy niż konkurencyjne podejścia (Double Sparsity, Loki, SparQ r=32) przy takim samym GPU time co SparQ r=16, ale czyta o 18 procent mniej bajtów i osiąga niższe błędy atencji na większości testowanych konfiguracji modeli. Na zadaniach typu RULER każdy scan per-token dopasowuje się do dokładnego top-k dekodowania, a w rzeczywistych sesjach coding-agentów Fathom osiąga poziom zgody najdokładniejszych skanów 136-bitowych przy użyciu zaledwie 92 bitów.

Ważnym praktycznym aspektem jest fakt, że metoda wykorzystuje 4-bitową kopię K cache już przechowywane w stosach serving z kwantyzacją. Jednak badacze zaznaczają, że Fathom nie przynosi korzyści szybkościowych, gdy indeks znajduje się w pamięci GPU, co ogranicza jego stosowanie do scenariuszy z pamięcią cache w host memory.