Naukowcy opublikowali pierwszą poważną recenzję zjawiska kolapsu modeli - problemu polegającego na degeneracji jakości modeli AI trenowanych na syntetycznych danych wygenerowanych przez poprzednie pokolenia sztucznej inteligencji. Chociaż wykorzystanie danych syntetycznych rozwiązało problem niedoboru dużych zbiorów treningowych, wprowadzi to nowy rodzaj ryzyka - w cyklicznym procesie między modelem a danymi modele ostatecznie ulegają degradacji.
Przyczynę tego problemu można znaleźć w samym procesie trenowania kolejnych pokoleń AI na danych wytworzonycj przez wcześniejsze modele. Jeśli model A generuje dane do trenowania modelu B, a następnie B trenuje model C, każda generacja może wzmacniać błędy i anomalie poprzednich iteracji. Takie kaskadowe pogorszenia jakości prowadzą ostatecznie do całkowitego kolapsu wydajności, podważając niezawodność systemów GenAI.
Opublikowany przegląd analizuje, jak zjawisko kolapsu modeli objawia się w różnych zastosowaniach - od przetwarzania języka naturalnego, przez generowanie obrazów, aż po inne domeny AI. Opracowanie mapuje również istniejące strategie mitygacji, takie jak mieszanie danych syntetycznych z rzeczywistymi danymi z sieci czy specjalne mechanizmy regularyzacji. Artykuł wskazuje na luki w wiedzy naukowej i formułuje wyzwania do rozwiązania przez przyszłe badania, stanowiąc punkt wyjścia do głębszego zrozumienia tego fundamentalnego problemu.