Naukowcy opracowali innowacyjną metodę ekstrakcji tzw. śladów rozumowania z dużych modeli językowych takich jak Claude, GPT i Gemini. Technika pozwala przeglądać wewnętrzne procesy decyzyjne tych systemów i zrozumieć, jak AI dochodzi do swoich wniosków.

To osiągnięcie ma znaczące implikacje dla bezpieczeństwa i transparentności AI. Możliwość zaglądania do wewnętrznych mechanizmów modeli otwiera nowe perspektywy dla badaczy zajmujących się interpretowalnością sztucznej inteligencji. Badacze twierdzą, że ich odkrycia wskazują na potencjalne powiązania między chińskimi modelami AI a wiodącymi amerykańskimi systemami, sugerując, że mogą one być trenowane na bazie zagranicznych technologii.

To badanie podkreśla znaczenie nadzoru nad rozwojem AI i konieczność lepszego zrozumienia, w jaki sposób te potężne systemy funkcjonują. Zdolność do ekstrakcji śladów rozumowania może stać się kluczowym narzędziem dla regulatorów i badaczy dążących do zapewnienia bezpieczeństwa i zgodności z wymogami etycznymi podczas dalszego rozwoju sztucznej inteligencji.