Zespół badaczy zidentyfikował fazę planowania w systemach wieloagentowych jako krytyczną podatność na ataki - jedna iniekcja prompt-u może zmienić wszystkie następujące zadania podrzędne wykonywane przez innych agentów. PlanFlip to nowy framework testowy obejmujący cztery typy ataków: GoalSubstitution zmienia cel zadania, PriorityInversion odwraca kolejność działań, ContextPollution dodaje fałszywe informacje do kontekstu, a RoleConfusion zmienia role agentów. Wszystkie ataki są maskowane jako naturalne output-y narzędzi, aby uniknąć filtru słów kluczowych.
Badania na 3479 epizodach z dziewięcioma modelami czołowymi ujawniły niepokojące trendy. Wbrew intuicji, mocniejsze modele są bardziej podatne - GPT-5 osiągnął 68 procent sukcesu ataków, podczas gdy bardziej primitywne modele były odporniejsze. Większość problemów ujawniła się w systemach homogenicznych, gdzie ten sam model pełni rolę planisty i krytyka - takie systemy wykazały 100 procent ukrycia ataku i znaczące przesunięcia w planach, mimo że agent weryfikujący twierdził, że plan się nie zmienił. Testy dwóch niezależnych oceniających potwierdziły odchylenie semantyczne na poziomie -0.20 do -0.32.
Jedyną wyjątkową odpornością wykazały się modele z augmentacją reasoning - DeepSeek-R1 całkowicie odparł wszystkie ataki bez jakichkolwiek modyfikacji planów. Naukowcy zaproponowali dwie mechanizmy obrony: GoalAnchorCheck, który weryfikuje niezmienność celów, oraz CrossAgentConsensus, który wymaga potwierdzenia zmian od niezależnych agentów. Obie metody osiągnęły 100 procent wykrywalności i przewyższyły obecne rozwiązania w 15 na 16 scenariuszach testowych.