Sakana AI zaprezentowała DiffusionBlocks - nowy framework, który pozwala trenować sieci neuronowe w niezależnych, modułowych blokach zamiast uczyć całą sieć od razu. Innowacja polega na konwersji tradycyjnych sieci residualnych w moduły denoisingu, które można uczyć osobno, a następnie łączyć w większe struktury. To fundamentalna zmiana podejścia do trenowania modeli - zamiast jednego dużego problemu optymalizacyjnego, mamy wiele mniejszych, bardziej zarządzalnych zadań.
Framework stanowi odpowiedź na rosnące wyzwania związane z skalą współczesnych modeli AI. Trenowanie ogromnych sieci neuronowych wymaga ogromnych mocy obliczeniowych i czasami trwa tygodniami czy miesiącami. Modułowe podejście Sakany teoretycznie może drastycznie zmniejszyć te wymagania - bloki mogą być trenowane niezależnie na mniejszych zbiorach danych i na słabszym sprzęcie, a następnie złożone w jedną większą strukturę. To otwiera drzwi dla mniejszych zespołów i organizacji, które dotąd nie mogły sobie pozwolić na treningi największych modeli.
Jeśli ta technologia zadziała w praktyce, może zrewolucjonizować sposób, w jaki projektuje się i optymalizuje modele sztucznej inteligencji. Modularne trenowanie mogłoby ułatwić eksperymentowanie, iteracje i doskonalenie - zespoły mogłyby testować różne kombinacje bloków bez konieczności ponownego trenowania wszystkiego od zera. To potencjalnie przyspieszy innowacje w branży i uczyni zaawansowaną AI bardziej dostępną dla szerszego grona naukowców i inżynierów.