Przemysł AI znajduje się w trudnym położeniu - jego własne badania nad bezpieczeństwem zawierają wiele ostrzeżeń, które nigdy nie są wdrażane w praktyce. CEO Anthropic jasno mówi, że gdyby firma i cały sektor w pełni zastosowali się do rekomendacji ze swoich publikacji naukowych, mogłyby już dziś wstrzymać lub znacznie spowolnić rozwój nowych modeli.
Hakiem tego problemu jest głęboki brak zrozumienia tego, jak modele AI działają wewnętrznie. Dla Anthropic bezpieczeństwo zależy od "interpretability" - umiejętności wyjaśnienia sposobu myślenia systemu. Jednak dotychczasowe badania w tej dziedzinie pokazują coś niepokojącego: systemy działają w niezrozumiałe dla naukowców sposoby, a ich decyzje trudno w pełni wyjaśnić. To oznacza, że bezpieczeństwo pozostaje na poziomie teoretycznym, podczas gdy praktyczne możliwości kontroli się zmniejszają.
Rozbieżność między nauką a przemysłem stanowi fundamentalny problem dla całego sektora. Firmy podkreślają zainteresowanie bezpieczeństwem w publicznie dostępnych badaniach, ale same zarazem przyspieszają wdrażanie systemów, których nie potrafią w pełni kontrolować. To oznacza, że rzeczywista polityka bezpieczeństwa jest zdeterminowana presją konkurencyjną, a nie solidnym zrozumieniem ryzyk.