Naukowcy przeanalizowali 13 modeli Qwen różnych rozmiarów, testując ich zdolność do posłuszeństwa instrukcjom, które bezpośrednio konfliktowały z wymogami zadania. Dla każdego z trzech przypadków - MCQA, klasyfikacji sentymetu i odpowiadania na pytania matematyczne - parowali standardową instrukcję ze sprzeczną wersją, która wymagała zignorowania normalnych zasad zadania. Oto przykład: zamiast wybrać prawidłową odpowiedź z wielu opcji, model miał wybrać błędną.
Wyniki pokazały wyraźny podział między małymi a większymi modelami. Małe modele zachowywały wysoką dokładność w standardowych zadaniach, ale rutynowo ignorowały sprzeczne instrukcje - co oznacza, że były kompetentne w samym zadaniu, ale nie potrafiły być kierowane przez użytkownika. Większe modele wykazywały znacznie większą wrażliwość na instrukcje, choć z dużymi różnicami między poszczególnymi zadaniami. Ta asymetria jest kluczowa dla praktycznego wdrażania modelów w rzeczywistych scenariuszach.
Badania mają ważne implikacje dla bezpieczeństwa AI i kontroli nad modelami. Rosnąca dokładność w zadaniach nie gwarantuje wystarczającej kontroli nad zachowaniem modelu ani niezawodnego posłuszeństwa instrukcjom. Autorzy wprowadzili metrykę Instruction-Following Failure Rate (IFFR), aby oddzielnie mierzyć zdolność do posłuszeństwa od dokładności zadania. To sugeruje, że ocena samych wyników mogą maskować potencjalne problemy z kontrolą modelu w rzeczywistych aplikacjach.