Zespół badaczy przedstawił AdaptiveSpec, metodę dekoderyzacji spekulacyjnej, która dla każdego kroku generowania tokenu dynamicznie dostosowuje sposób weryfikacji i kształt drzewa draftu. Dotychczasowe podejścia takie jak EAGLE-3 utrzymywały sztywne reguły - wymagały dokładnego dopasowania proponowanych tokenów i ustalonych struktur drzewa. AdaptiveSpec zmienia ten paradygmat, wprowadzając per-step margin rule, która promuje niedopasowany token jeśli stosunek prawdopodobieństwa celu do wartości top-1 przekroczy określony próg. Ta reguła marginesu nie zależy od długości draftu ani architektu draftera, co czyni ją uniwersalną.
Drugim kluczowym elementem jest adaptacyjna polityka drzewa, która w czasie rzeczywistym dostosowuje głębokość, szerokość i liczbę węzłów na podstawie zaufania top-1 draftera oraz historii ostatnich zaakceptowań. W przeciwieństwie do poprzednich metod, całkowita liczba draftów może się zmieniać zamiast być tylko przesuwana między poziomami. Te dwie adaptacje pracują na ortogonalnych osiach i wzajemnie się wzmacniają.
Wdrożone na produkcyjnym silniku SGLang, AdaptiveSpec wykazuje przyspieszenie przepustowości do 56 procent w stosunku do EAGLE-3, jednocześnie odzyskując 93 procent do pełnej dokładności bez strat w testach zadań. Ponieważ nie wymaga dodatkowego treningu, metoda może być natychmiast zastosowana do istniejących modeli i architektur, co czyni ją praktycznie istotną dla optymalizacji wnioskowania w rzeczywistych aplikacjach.