Naukowcy z arXiv wprowadzili DuplexSpeechBench-IFEval, nowy benchmark specjalizujący się w ocenie zdolności agentów głosowych do niejawnego wykonywania instrukcji w rzeczywistej konwersacji. W przeciwieństwie do istniejących benchmarków, które testują zachowania poprzez jawne instrukcje dotyczące zarządzania turami, DSB-IFEval skupia się na tym, jak agenty uczą się odpowiedniego zachowania z przypisanej roli lub persony. Benchmark zawiera 1038 przypadków testowych obejmujących osiem różnych ról asystenta i testuje pięć protokołów warunkowania instrukcji: zachowanie domyślne, jawne instrukcje behawioralne, zachowanie implikowane personą, połączone kondycjonowanie persona-reguły oraz konflikty instrukcji.
Badacze wprowadzili dwie metryki do oceny wydajności: Instruction Adherence Score (IAS) mierzący zarządzanie przebiegiem rozmowy w czasie rzeczywistym oraz Persona Adherence Score (PAS) oceniający spójność treści z personą. Testy przeprowadzono na sześciu systemach real-time, w tym F-Actor, PersonaPlex, GPT-Realtime, MiniCPM-o i Fun-Audio-Chat. Wyniki ujawniły istotne różnice architektoniczne - modele full-duplex takie jak F-Actor i PersonaPlex wykazały spadek wydajności zarządzania głosem o 9,7 procent i 4,5 procent odpowiednio, gdy instrukcje były tylko implikowane w personie zamiast jawnie podane.
Z drugiej strony GPT-Realtime, MiniCPM-o i Fun-Audio-Chat wykazały silne trzymanie się instrukcji związanych z personą w zawartości rozmowy, ale ich zarządzanie przebiegiem rozmowy nie dostosowywało się równie dobrze. Badanie pokazuje fundamentalne kompromisy między rozmaitymi architekturami agentów głosowych - systemy mogą być albo dobre w jawnym śledzeniu instrukcji, albo w intuicyjnym odczytywaniu intencji z persony, ale trudno jest osiągnąć obydwa jednocześnie.