Naukowcy opracowali metodę sterowania sposobem myślenia modelu językowego Kimi 2.6 bez zmiany jego wag. Descobrili, że wewnątrz trendu modelu istnieje niskowymiarowa struktura sterowania, którą można wykorzystać do wpływania na jego proces decyzyjny. Zamiast przeprowadzać kosztowne dotraining, metoda Metacognitive Steering działa na poziomie inference, czytając bieżący režim poznawczy modelu i dynamicznie stosując interwencje do różnych warstw sieci neuronowej.

Tradycyjne modele językowe są trenowane głównie na produktach nauki - opublikowanych artykułach i wynikach - z sygnałami optymalizacyjnymi na poziomie wyników. To daje ograniczone wsparcie dla procesu myślenia naukowców, który wymaga przechodzenia między eksploracyjnym badaniem, dyscyplinowaną eksekucją i krytyczną oceną w miarę zmiany dowodów. Zespół zbierał rzeczywiste dane od pracujących naukowców, analizując ich interakcje contrastive interventions. Residual analysis, alignment wag attention oraz decomposition wartości singularnych wskazały na kontrolną powierzchnię w środkowych warstwach sieci.

System Columbus-1 zbudowany na metodzie Metacognitive Steering udowodnił praktyczną wartość tej idei. Autonomous agent odkrył osiem niezależnie potwierdzonych luk bezpieczeństwa w oprogramowaniu BlueZ, które mogą być wykorzystane przez atakujących. To pokazuje, że sterowanie procesami poznawczymi modelu nie jest tylko teoretycznym ćwiczeniem - rzeczywiście prowadzi do nowych odkryć w praktycznym badaniu naukowym.