Naukowcy opracowali BF1, metodę optymalizacji atencji w transformerach, która redukuje koszty obliczeniowe obsługi długich kontekstów. Zamiast obliczać atencję dla wszystkich par tokenów naraz, BF1 selektywnie wybiera interakcje: każda pozycja komunikuje się z bliskim sąsiedztwem, pierwszym blokiem całej sekwencji oraz rozłożonymi historycznymi blokami. Ta architektura zmniejsza liczbę operacji z O(n²) do O(n log n) przy zachowaniu O(log n) głębokości komunikacji między warstwami.
Testy pokazują praktyczną przydatność metody. Na GPU Blackwell optymalizowana implementacja BF16 przebija gęstą atencję między 2K a 4K tokenami, osiągając 10,91x przyspieszenie dla pojedynczej warstwy przy 32K tokenach. Co ważne, naukowcy nie zamieniają wszystkich warstw - retrofit tylko ośmiu z 28 warstw atencji w modelu Qwen3-0.6B zmniejsza warm time to first token o 7,7% przy 8K tokenach, 11,3% przy 16K i 15,3% przy 32K. Pozostałe gęste warstwy zapewniają, że model zachowuje możliwość asymptotycznie kwadratowego skalowania, jeśli potrzeba.
Ważna nowość to correctness-gated retrofit - metoda bezpiecznego przystosowania pretrenowanych modeli bez przeszkolenia od zera. Pod protokołem adaptacji 1000 kroków na 16,384M tokenach BF1 uzyskał najniższą perpleksję (1,68639) w stosunku do porównań ze statyczną grafią losową (1,69154), gęstą kontynuacją (1,69258) i lokalnym sliding window (1,81505). To sugeruje, że logarytmiczny schemat rzadkości nie degeneruje zdolności uczenia się modelu.