Badacze porównali pięć hipotez dotyczących właściwości filtrów w frequency-collapse attention - mechanizmie, który zastępuje iloczyn skalarne Q/K filtrowaniem na wybranej częstotliwości. Eksperymenty na modelie 6-warstwowego GPT-a trenowanego na TinyShakespeare ujawniły, że komponenty DC i Nyquist aktywnie szkodzą wydajności (wartość validacji zbliżona do efektu randomizacji fazy), co potwierdza, że kluczowa jest oscylacyjna struktura bandpass, a nie dowolne niskowymiarowe podsumowanie spektralne.

Optymalna przepustowość pojedynczej skali wynosi sigma około 2 histogramów i daje zysk +1.15 nats w porównaniu z dot-product baseline'm. Filtry dopuszczalne - zwłaszcza Mexican Hat (DOG m=2) o zerowej średniej - wypadają lepiej niż gaussowskie przy tej samej skali i oferują ochronę przed dwustronnymi wyciekami FFT. Odkrycie pokazuje również monotoniczne skalowanie wycieku FFT z pokryciem spektralnym: wąskopasmowe filtry z luką powyżej 4 są czyste, natomiast szerokopasmowe poniżej 2 są przeciekowe.

Wyniki sugerują, że kauzalny Morlet w dziedzinie czasu na skali znakowej nie przebija baseline'u, co motywuje rozszerzenie eksperymentów na poziom słowny. Łącznie badanie dostarcza konkretnych wytycznych dotyczących projektowania filtrów dla frequency-collapse attention i wyjaśnia fundamentalne ograniczenia wynikające z wycieku FFT.