Naukowcy przedstawili HB-SJD, ulepszoną wersję Speculative Jacobi Decoding przystosowaną do batch'owego przetwarzania w wizualnej nauce on-policy. Problem polegał na tym, że tradycyjne autoregresyjne dekodowanie w trakcie trenowania generuje tokeny sekwencyjnie, co znacznie wydłuża każdy krok trenowania.

Nowa metoda pozwala każdemu obrazowi postępować niezależnie w procesie dekodowania, jednocześnie weryfikując obrazy na różnych pozycjach w sekwencji za pomocą wspólnych obliczeń modelu. Kluczową innowacją jest dynamiczne przełączanie się między trybami Full i Compact wykonania podczas kolejnych rund generowania - gdy niektóre obrazy się kończą, system może zredukować koszt obliczeniowy dla pozostałych. Podejście jest eleganckie, bo wymaga tylko zamiany backend'u generowania danych treningowych, bez zmian w samym modelu nauczyciela, funkcji distillacji czy procedurze optymalizacji.

Testy przeprowadzone z wykorzystaniem LlamaGen wykazały, że HB-SJD znacznie skraca czas rollout'ów i całkowity czas trenowania, jednocześnie utrzymując jakość generowanych obrazów przez destylowany model. To istotne ulepszenie dla trenowania kompaktowych modeli, gdzie szybkość generowania danych treningowych bezpośrednio wpływa na wydajność całego procesu nauki.