Anthropic Frontier Red Team wykazała, że współczesne modele językowe nauczają się samodzielnie opracowywać zaawansowane ataki cybernetyczne. W testach na 100 zadaniach z benchmarku Binary Exploitation model GLM-5.3 osiągnął kontrolę przepływu programu w 4% prób, a Claude Mythos Preview w 6%, podczas gdy starsze wersje - Claude Opus 4.6 i GLM-5.2 - nie potrafiły tego robić w żadnym przypadku.

To odkrycie jest istotne, ponieważ wskazuje na wyraźny skok możliwości w ostatnich generacjach modeli. Najpierw oznacza to, że zdolność do opracowywania ataków na kontrolę przepływu nie jest już przypadkową cechą, ale powtarzalnym umiejętnością. Po drugie, sugeruje, że ta umiejętność rozprzestrzenia się między różnymi rodzinami modeli - zarówno te zachodnich firm jak i chińskie GLM wykazują te możliwości.

Implikacje bezpieczeństwa są poważne. Modele mogą teraz być wykorzystane do automatyzacji lub wspierania zaawansowanych cyberataków, co tradycyjnie wymagało doświadczenia specjalistów. To skłania badaczy bezpieczeństwa do myślenia o tym, jak kontrolować i limitować rozprzestrzenianie się takich zdolności, szczególnie w kontekście międzynarodowej konkurencji w technologiach AI.