Naukowcy starają się zrozumieć, jak połączyć możliwości dużych modeli widzenia i języka z ideą Picbreedera - systemu, który potrafi generować zupełnie nowe i zaskakujące obrazy poprzez stopniowe, iteracyjne ulepszanie. Problem polega na tym, że większość dzisiejszych modeli AI nie potrafi rzeczywiście tworzyć czegoś nowego - głównie replikuje to, na czym się uczyła. Badacze chcą poznać mechanizmy, które pozwoliłyby modelom Vision-Language wyjść poza naśladownictwo i osiągnąć autentyczną kreatywność. To pytanie fundamentalne dla całego pola AI generacyjnego: czy sztuczna inteligencja może być rzeczywiście twórcza, czy skazana jest jedynie na recykl istniejących wzorców?

Picbreeder - system opracowany kilkanaście lat temu - pozwala użytkownikom coraz bardziej ulepszać obrazy poprzez naturalna selekcję, odkrywając przy tym możliwości, o których nie wiedzieli, że istnieją. Badania wskazują, że ta "otwartość" - zdolność do encuentru z nieoczekiwanymi rezultatami - wynika z konkretnych cech projektowania systemu. Naukowcy teraz rozpracowują, które elementy współczesnych dużych modeli mogą wspierać podobny proces, a które stanowią barierę dla spontanicznej innowacji.

Zrozumienie tych mechanizmów ma praktyczne znaczenie dla każdego, kto pracuje z AI generacyjnym - od artystów po inżynierów. Jeśli uda się zidentyfikować ingerdenssy otwartości w modelach Vision-Language, mogłoby to zmienić sposób, w jaki projektujemy narzędzia twórcze oparty na sztucznej inteligencji. Mogą one przestać być zaledwie tłumaczami poleceń użytkownika na obrazy, a stać się rzeczywistymi partnerami w procesie odkrywania nowych możliwości estetycznych i koncepcyjnych.