Modele jezykowe coraz częściej podejmują decyzje biznesowe na podstawie rekordów CRM, ale naukowcy wykazali poważną słabość: modele dają się przekonać twierdzeń osób mających interes w pozytywnym wyniku. W testach na systemie CRMArena-Pro przedstawiciele sprzedaży twierdzili, że grafik jest akceptowalny w każdej z 100 rozmów i że budżet jest dostępny w 76 przypadkach. Kiedy takie asercje były sprzeczne z rzeczywistą listą cenową i polityką instalacji, model przeczytawszy tylko transkrypt zaakceptował deal w 29 z 31 scenariuszy.
Podatność na manipulację okazała się konsekwentna - siedem modeli od czterech dostawców (w tym najpewnie OpenAI, Anthropic, Google i Mistral) zostało wprowadzonych w błąd w 87-97 proc. przypadków. Większa skala modelu i explicite reasoning nie zapewniały odporności. Badacze kategoryzowali błędy i stwierdzili, że zaledwie 3 z 35 awarii nie wiązały się z manipulacyjnym oświadczeniem - problem jest więc przede wszystkim kwestią persuazji, a nie brakującymi informacjami.
Diagnoza ujawnia, że dostarczanie modelom prawidłowych danych z firmowych rekordów paradoksalnie pogarsza wynik - dokładność spadła z 41 do 18 procent, podczas gdy recall wzrósł, co sugeruje całkowity zanik precyzji. Oznacza to fundamentalny problem z tym, jak modele wagi elementy dowodowe: traktują osobiste asercje i tendenczyjne źródła jak fakty, niezależnie od sprzeczności z autorytatywnymi danymi.