Zespół badawczy zaproponował nową technikę pruningów strukturalnych dla transformerów wizyjnych i językowowych, która inteligentnie wybiera które komponenty usunąć. Zamiast tradycyjnych metod opartych na wielkości parametrów czy statycznych miarach ważności, podejście traktuje problem jako wieloramienny bandit - iteracyjnie testuje usuwanie poszczególnych attention heads i kanałów MLP, mierząc rzeczywisty wpływ na stratę dla tego samego batcha danych. To znacznie zmniejsza zmienność między batchami i prowadzi do bardziej trafnych decyzji.

Badacze przetestowali metodę na dziewięciu znanych modelach: GPT-2, OPT, Pythia, Qwen2.5, SmolLM2 dla języka oraz ViT-B/16, DeiT-Tiny i Swin-Tiny dla wizji. Eksperymenty na zbiorach WikiText-2, LAMBADA i Imagenette pokazały, że bandit-based selection zwykle zmniejsza degradację wydajności w stosunku do obecnego standardu - greedy selection z ograniczonym budżetem ewaluacji. Z 28 porównań wyróżnionych w pracy, 23 przedziały ufności nie zawierają zera, a 11 testów parowanych ma p < 0,05.

Signifikancja tego podejścia leży w możliwości bardziej efektywnej kompresji modeli przy zachowaniu ich zdolności. Zamiast fizycznego usuwania parametrów (co wymaga przebudowy sprzętu), komponenty są strukturalnie zerowane, co ułatwia implementację. Metoda ma potencjał poprawy praktycznej wydajności modelów na urządzeniach o ograniczonych zasobach bez konieczności pełnego retrainingu.