Naukowcy z badań na arXiv opracowali metodę TEXAS do adaptacji modeli Mixture-of-Experts, która w 17 z 18 testowanych scenariuszy osiąga najlepsze lub porównywalne wyniki z dotychczasowymi podejściami. Kluczowa innowacja polega na identyfikacji ekspertów poprzez porównanie wzorców aktywacji na instancjach, które model rozwiązuje poprawnie, z tymi, na których się myli - wtedy eksperci bardziej aktywowani na udanych przykładach są zachowywani mocniej podczas fine-tuningu.

Dotychczasowe podejścia opierały się na statystykach agregacyjnych routingu, które pokazywały jedynie, które eksperci były najczęściej używani, nie wskazując jednak na ich rzeczywisty związek z poprawnością rozwiązań. TEXAS zmienia to podejście, analizując token po tokenie, które eksperci aktywują się w kontekście poprawnych i niepoprawnych odpowiedzi. Podczas adaptacji metoda zwiększa wagę tokenów odpowiedzi w nieudanych instancjach, gdy aktywują te istotne eksperci, kierując proces uczenia w bardziej świadomy sposób.

Ważne jest to, że TEXAS nie ogranicza się do stałego podzbioru ekspertów ani nie narzuca zewnętrznego rozkładu routingu - zamiast tego pracuje w ramach istniejącego zachowania modelu. Badania na trzech modelach MoE i sześciu benchmarkach pokazują średnią poprawę 1,3-1,5 punktu nad wcześniejszymi metodami, co sugeruje, że może to być praktyczne podejście do bardziej efektywnego fine-tuningu dużych modeli bez dodatkowych ograniczeń architekturalnych.