Osprey to nowe podejście do trenowania drafterów dla spekulacyjnego dekodowania, czyli techniki przyspieszającej wnioskowanie LLM-ów. Problem stanowi fakt, że dotychczasowe draftery były znane jako mało odporne - trenowano je dla konkretnych modeli docelowych i osiągały one wysoki acceptance rate tylko w znanych warunkach, a przy zmianach ulegały drastycznej degradacji wydajności.
To stanowi paradoks w stosunku do ewolucji samych LLM-ów, gdzie duże modele docelowe ceniane są właśnie za swoją zdolność do generalizacji zdobytą w trakcie dużoskalowego pretrainingu. Dotychczasowe podejścia do trenningu drafterów miały strukturę dependentną od celu - drafter konsumował stany ukryte modelu docelowego i był distillowany na jego logitach, co oznaczało że pretraining musiał być powtarzany dla każdego nowego celu.
Osprey zmienia tę logikę poprzez bootstrapping drafterów z dostępnych gotowych pretrenowanych małych modeli języka. Uniwersalne pretraining staje się ponownie używalnym, niezależnym od celu zasobem, a prace dostosowawcze per-model redukują się do lekkiej fazy adaptacji. Aby to zadziałało, zespół musiał rozwiązać dwa wyzwania: małe LM-y są o wiele głębsze niż toleruje opóźnienie drafter, oraz pretrenowany computation musi pozostać zachowany podczas gdy drafter uczy się przyjmować stany ukryte z modelu docelowego i emitować tokeny w jego słowniku. Osprey radzi sobie przez pruning do płytkiego backbone'u, przywrócenie zdolności modelowania języka poprzez target-agnostyczne pretraining na predykacji kolejnego tokena, i adaptację do każdego celu poprzez alignment słownika, inicjalizację QKV expansion na zera oraz distillację od modelu docelowego.