Badacze zaproponowali nowe podejście do przyspieszenia inferencji dużych modeli językowych, które zastępuje tradycyjne gęste projekcje wyjściowe przeszukiwaniem wektorowym. Zamiast przetwarzania całej macierzy embedingów słownika podczas każdego kroku dekodowania, nowa metoda wykorzystuje indeksy HNSW do znalezienia tylko małego zestawu kandydujących tokenów o najwyższych punktacjach.
Problemem, który rozwiązuje ta metoda, jest wąskie gardło przepustowości pamięci powstające w wyniku dużych macierzy embedingów wyjściowych, szczególnie w kompaktowych modelach z rozległymi słownikami wielojęzycznymi. Zamiast gęstych operacji, podejście oparte na indeksach wektorowych wykonuje maksymalne przeszukiwanie produktu wewnętrznego - faza, którą można znacznie przyspieszyć. Pobrane logity są następnie rozpraszane w rzadkim tensorze pełnego słownika, co pozwala na integrację z istniejącymi potokami dekodowania.
Wynajęcia testów na CPU z modelami Gemma 3, Llama 3.2 i Qwen 3 wykazały substancjalny wzrost wydajności - dekodowanie batch-size-one przyspieszyło się o do 82 procent dla Gemmy 3 270M, przy jednoczesnym zachowaniu jakości generowania tekstu w ewaluacji AlpacaEval. To sugeruje, że przybliżone przeszukiwanie wektorowe jest praktyczną alternatywą dla gęstych projekcji wyjściowych w scenariuszach wrażliwych na latencję z pojedynczymi próbkami.