TreeSpark to nowa technika optymalizująca speculative decoding - proces, w którym tani model drafter proponuje tokeny, a docelowy model weryfikuje je równolegle. Dotychczasowe podejścia wykorzystują stałe rozmiary drzew kandydatów i rangują je podle marginalnych prawdopodobieństw na poszczególnych pozycjach, co prowadzi do wielu błędnie uszeregowanych węzłów. TreeSpark zmienia to podejście, odczytując rozkład warunkowany rodzicami bezpośrednio z istniejącej głowicy Markova drafter'a, następnie kalibrując go na estymację akceptacji krawędzi.

Klucz do wydajności leży w adaptacyjności systemu. Zamiast utrzymywać drzewo o stałym rozmiarze, TreeSpark dynamicznie rozszerza strukturę w oparciu o stopień przeżycia ścieżek - czyli którzy kandydaci rzeczywiście przechodzą weryfikację. System zatrzymuje ekspansję w każdej rundzie w zależności od tego, ile spekulacji może aktualnie zaakceptować sieć. Gdy obciążenie serwera rośnie, drzewo gracefully kurczy się z powrotem do prostego łańcucha.

Wyniki są imponujące: wobec dostrojonych metod łańcuchowych TreeSpark akceptuje 15-25% więcej tokenów draftu na rundę i dekoduje 8-14% szybciej w testach single-request. Metoda zachowuje dekodowanie bezstratne w dowolnej temperaturze dzięki próbkowaniu rodzeństwa bez zastępowania z dopasowanymi residualami w rekurencyjnym rejection samplingiem. Kod i artefakty zostały udostępnione na GitHub'ie.