Zespół badawczy opracował Hermesa, rodzinę architektur harnessu, które stopniowo przesuwają kontrolę nad alokacją i ponownym wykorzystaniem kontekstu z inżynierów na sam model. Zamiast sztywno prescribować, jak model powinien zarządzać wieloma oknami kontekstowymi podczas wnioskowania, Hermes pozwala modelom uczyć się tych decyzji poprzezprocess treningowy.

Kluczowym składnikiem jest Hermes-Learn, dwustopniowy framework treningowy, który indukuje u modeli zdolności do kontekstowego rozumowania. Badania pokazują, że większe modele mogą naturalnie wykorzystywać tę elastyczność do skalowania z dodatkowymi obliczeniami, ale mniejsze modele open-source wymagały osób treningowych. Po treningu z Hermes-Learn nawet mniejsze modele rozwijają adaptacyjne strategie, które dynamicznie dostosowują się zarówno do typu problemu, jak i postępu w rozumowaniu.

Wyniki ukazują znaczną generalizację - zyski z treningu przekładają się na różne benchmarki i rodziny modeli, ekstrapolują się poza obliczenia widziane podczas treningu i kompatybilne są z innymi podejściami do test-time scalingu. To stanowi potencjalny krok naprzód w obszarze adaptacyjnego skalowania wnioskowania, gdzie modele mogą inteligentnie decydować, kiedy warto alokować więcej compute w zależności od trudności problemu.