Naukowcy z Anthropic zdemonstrował, że zautomatyzowane systemy mogą poprawiać wydajność na benchmarkach dotyczących niewyrównanego zachowania AI, utrzymując jednocześnie ogólną wydajność na niezmienionym poziomie. W teście wykorzystano 10 benchmarków skoncentrowanych na specyficznych przypadkach błędnego wyrównania systemów, a we wszystkich przypadkach systemy osiągnęły polepszenie.

To odkrycie jest istotne, ponieważ wskazuje na możliwość stworzenia AI zdolnego do samopolepszania się bez konieczności bezpośredniej interwencji człowieka. Tradycyjnie doskonalenie systemów AI wymagało ręcznego dostrojenia i nadzoru ze strony inżynierów. Jeśli maszyny potrafią automatycznie identyfikować i naprawiać swoje błędy zachowania, może to prowadzić do znacznie szybszego postępu, ale również rodzi pytania o kontrolę i przewidywalność takich systemów.

Wyniki te stanowią część szerszych badań nad bezpieczeństwem AI i wyrównaniem wartości, których Anthropic zajmuje się od samego początku. Choć wyniki są obiecujące, naukowcy podkreślają znaczenie dalszych badań nad granicami tego podejścia oraz potencjalnymi ryzykami związanymi z systemami, które mogą się samodoskonalić bez zewnętrznego nadzoru.