TreeGraft to nowa metodologia, która rozwiązuje fundamental problem speculative decodingu - techniki przyspieszającej inferencję dużych modeli językowych poprzez draft-then-verify paradygmat. Zamiast polegania na jednym draft-modelu przez wszystkie kroki, system inteligentnie łączy draftery o różnych rozmiarach w jedno wspólne drzewo kandydatów.
Problем klasycznych tree-structured metod polegał na swoistym dylemapie: mały drafter pracuje szybko ale generuje słabą jakość drzewa, większy drafter poprawia jakość ale powoduje dużą latencję. TreeGraft rozwiązuje to poprzez hierarchiczne podejście - słabszy drafter pracuje szybko jako fundacja, a silniejszy drafter strategie ponownie ocenia kandydatów, zmienia pozycje grafowania i odzyskuje obiecujące ścieżki pozostawione niezbadane. Kluczowa innowacja to lekki scheduler wytrenowany offline na systemie wartości, który decyduje kiedy przywołać mocniejszy model. Nie niszczy to istniejących gałęzi drzewa, co pozwala targetowemu modelowi nadal je akceptować.
Wyniki empiryczne są imponujące - across 10 par modeli i 6 benchmarków, TreeGraft osiąga średnio 15,1% wzrost wydajności w stosunku do lepszej z dwóch strategii jednodrafterowych, z maksymalnym wzmocnieniem 26,6%. To sugeruje realne znaczenie dla praktycznego przyspieszenia LLM inference bez kompromisu w jakości.