Naukowcy opracowali metodę SaFeR-Steer, która uczy wieloturowe modele multimodalne uczenia się lepszych umiejętności konwersacyjnych dzięki syntetycznie generowanym danym. Innowacyjne podejście wykorzystuje mechanizmy sprzężenia zwrotnego, aby modele MLLM - takie jak GPT-4V czy Claude - uczyły się prowadzenia bardziej naturalnych i kontekstowych rozmów obejmujących zarówno tekst, jak i obrazy. To rozwiązanie stanowi odpowiedź na ograniczenia obecnych sztucznych inteligencji, które często zawodzą w złożonych, wieloturowych interakcjach, gdzie trzeba pamiętać poprzednie części dialogu i reagować inteligentnie na nowe informacje wizualne.

Zamiast polegać wyłącznie na kosztownych i czasochłonnych danych zanotowanych ręcznie przez ludzi, badacze zastosowali syntetyczny bootstrapping - czyli automatyczne generowanie przykładów treningowych przez istniejące modele. Proces ten pozwala na szybkie i skalowalne tworzenie dużych zbiorów danych treningowych, które wcześniej byłyby niedostępne. Mechanizmy sprzężenia zwrotnego służą do oceny jakości generowanych dialogów i iteracyjnego ulepszania modelu, co przypomina proces, w którym system uczy się od siebie samego, stopniowo poprawiając swoje odpowiedzi.

Praktyczne znaczenie tej metody jest duże dla branży AI. Modele MLLM znajdują zastosowanie w asystentach wirtualnych, systemach analityki wizualnej dla biznesu oraz interfejsach człowiek-komputer. Lepsze zdolności dialogowe oznaczają, że takie systemy będą bardziej przydatne i mniej frustrujące dla użytkowników w rzeczywistych scenariuszach. SaFeR-Steer otwiera też drzwi do bardziej efektywnego trenowania nowych modeli bez konieczności gromadzenia masowych zbiorów ręcznie anotowanych danych, co mogłoby zmienić ekonomikę rozwoju zaawansowanych sztucznych inteligencji.