Zespół badawczy opracował metodę łączenia zamrożonych modeli z różnych architektur poprzez trenowanie pojedynczego adaptera w wspólnej przestrzeni utajonej. Podejście polega na uruchomieniu pierwszych warstw jednego modelu, konwersji reprezentacji pośredniej za pomocą adaptera, a następnie uruchomieniu pozostałych warstw drugiego modelu. Po wytrenowaniu adaptera można uzyskać kilka złożonych modeli bez ponownego trenowania.

Eksperymenty z RWKV-4-Raven-7B (model rekurencyjny) i Tulu-Pythia-6.9b (oparty na Transformer) pokazały obiecujące rezultaty w niektórych aspektach. Konfiguracja połączenia pierwszych pięciu warstw Pythii z pozostałymi 27 warstwami RWKV zmniejszyła pamięć cache o 84,4 procent przy dokładności na pytaniach wielokrotnego wyboru porównywalnej z samym RWKV. Wygenerowany tekst był syntaktycznie poprawny.

Jednak badanie ujawniło znaczące ograniczenia tego podejścia. Żaden z złożonych modeli nie dorównał wydajności modelu Pythia, a wydajność modelowania językowego drastycznie spadła na WikiText - zbiorze artykułów Wikipedii spoza domeny treningowej. Odpowiedniego mapowania reprezentacji pośrednich udało się uzyskać tylko w przypadku wspólnego tokenizera, tej samej głębokości i tej samej szerokości ukrytych stanów. Wyniki sugerują, że chociaż techniczne połączenie modeli z różnych rodzin jest możliwe, praktyczne korzyści są ograniczone przez architekturalne różnice i domeny treningowe.