Badacze z arXiv zaprezentowali TinyCeNN-LM, nową metodę do bezpiecznej zamiany mechanizmu attention w pretrenowanych modelach języka naturalnego na warstwy inspirowane architekturą komórek neuronowych (CeNN). Problem, który rozwiązuje ta praca, jest fundamentalny: zastąpienie attention w modelu, który już się nauczył pracować z tym mechanizmem, może zaburzyć reprezentacje oczekiwane przez kolejne warstwy sieci.
Framework wprowadza tak zwane quality-gated post-training conversion, czyli konwersję po treningu z bramkami kontroli jakości. Zaproponowano trzy implementacje: Integrated Memory, MemoryFusion i PDelta3-GDN2-CLVR+Local32. Kluczowa innowacja to podejście accept-or-rollback validation - każda konwertowana warstwa jest zaakceptowana lub odrzucona na podstawie dwóch kryteriów: utrzymania wierności reprezentacji oraz poziomu straty (mierzonej jako zmiana negative log-likelihood). Na modelu SmolLM2-135M warstwy 0-2 zostały zaakceptowane z kumulacyjną zmianą NLL zaledwie +0.01209, jednak warstwa 3 została odrzucona pomimo zadowalającej straty, ponieważ reprezentacja się zbyt mocno zmieniła. Na większym modelu Qwen3.5-0.8B zaakceptowano pełne warstwy attention na pozycjach 3, 7 i 11 z finalną zmianą NLL +0.02073.
Wyniki pokazują praktyczną wartość tej konserwatywnej konwersji: model Integrated Memory utrzymywał perplexity w przedziale -0.07% do +0.93% wobec oryginalnego modelu, jednocześnie zmniejszając całkowitą pamięć cache nawet o 6.01%. Test sanity check na 200 dowolnie wybranych zadaniach dla skonwertowanych wersji modelu Qwen dał dokładność 28.5-32.0%. Praca sugeruje, że zamiast uniwersalnego zamieniania attention lub pogonią za przyspieszeniem, lepiej jest zastosować ostrożne, sterowane jakością podejście do konwersji architektur.