WavePrune to nowa metoda optymalizacji Rotary Position Embedding, techniki kodowania pozycji tokenów poprzez rotację wektorów query i key w określonych częstotliwościach. Problem polega na tym, że RoPE ma strukturę okresową, co powoduje aliasowanie pozycji - pozycje względne oddalone o pełny okres rotacji stają się trudne do rozróżnienia dla modelu. Prowadzi to do niepotrzebnych zaburzeń w mapach atencji.

Proponowana metoda po prostu ogranicza każdy kanał do jego pierwszego okresu rotacji, eliminując redundantne okresy. Testy wykazały, że struktura okresowa RoPE - powszechnie uważana za kluczową - okazuje się w dużej mierze zbędna poza pierwszym okresem. Podejście to ulepszało wyniki na czterech z pięciu przetestowanych modeli bez dodatkowego dostrojenia, osiągając wzrost HELMET score na Qwen3-8B z 35,7 do 40,0.

Bonusem jest znaczny wzrost wydajności - implementacja CUDA zoptymalizowana pod względem sprzętu osiąga przyspieszenie 1,15x dla fazy prefill i 1,24x dla dekodowania w stosunku do FlashAttention-2 na kontekście 32K. Ograniczenie każdego kanału do okna przesuwającego się indukuje drobną sparsość, którą jądra CUDA potrafią efektywnie wykorzystać. Rezultaty pokazują, że można znacznie uprościć RoPE bez utraty - a wręcz ze wzrostem - wydajności modelu na długich kontekstach.