Naukowcy zbadali, czy hipersieći mogą być wykorzystane do wstrzykiwania wiedzy podczas fazy treningu i jak zmienia się ta zdolność wraz ze skalowaniem. Zamiast tradycyjnego zastosowania hipersieći do adaptacji w czasie testowania, zespół trenuje hipersieć do generowania stałego adaptera LoRA, który wstawiany do modelu docelowego umożliwia mu odpowiadanie na pytania o fakty z dużego zbioru danych.
Kluczowym osiągnięciem jest oddzielenie zdolności wstrzykiwania hipersieći od ogólnych możliwości modelu docelowego, co po raz pierwszy pozwoliło na rygorystyczne badanie praw skalowania dla architektur hipersieći. Naukowcy charakteryzowali, jak strata, dokładność rozumowania i uogólnianie poza rozkład danych (OOD) zmieniają się wraz z głębokością i szerokością hipersieći oraz rozmiarem sieci docelowej.
Wyniki eksperymentów na dataset MegaWikiQA zawierającym dziesiątki milionów przykładów pytań wieloetapowych na 39 domeny pokazują, że hipersieć-oparte wstrzykiwanie wykazuje przewidywalne prawa skalowania potęgowego na wszystkich osiach architekturowych, a hipersieći są zdolne do niezawodnego uogólniania w scenariuszach poza rozkład treningowy. Odkrycie to ma znaczenie dla efektywnego rozszerzania zdolności modelów językowych do przyswajania nowej wiedzy bez konieczności pełnego dostroju całego modelu.