Tencent open-sourcował AngelSpec, PyTorch-natywny framework treningowy do modeli draft wykorzystywanych w speculative decoding - technice, która przyspiesza generowanie tekstu przez duże modele AI. Framework obsługuje zarówno autoregresywne multi-token prediction (MTP) jak i block-parallel DFlash, ale jego nowością jest podejście dostosowujące się do różnych typów pracy.
Speculative decoding działa poprzez lekki model draft, który proponuje kilka przyszłych tokenów, a następnie główny model weryfikuje je jednocześnie w jednym forward pasie. Przyspieszenie zależy od dwóch rzeczy: ile zaproponowanych tokenów zostanie zaakceptowanych oraz jak długo trwa całej rundy draft-verify. Problem polega na tym, że te dwie wielkości działają w przeciwnych kierunkach. W otwartych rozmowach wiele kontynuacji jest semantycznie poprawnych, więc akceptacja szybko spada wraz z głębokością propozycji - długie bloki to marnowanie mocy obliczeniowej. Natomiast w kodzie i matematyce - gdzie składnia, identyfikatory i sformalizowane wyrażenia znacznie bardziej ograniczają następne tokeny - można proponować znacznie dłuższe sekwencje.
AngelSpec zmienia podejście poprzez traktowanie heterogeniczności obciążeń jako warunku projektowego pierwszej klasy. Zamiast szukać jednego uniwersalnego draft modelu, który średnio działa dobrze na wszystkich benchmarkach (co nie odpowiada rzeczywistemu ruchowi serwerów), framework specjalizuje strukturę, dane treningowe i głębokość weryfikacji dla konkretnych scenariuszy. To pozwala na znacznie lepsze przyspieszenie niż tradycyjne podejścia jednego drafter-dla-wszystkich.