NVIDIA opracowała praktyczną metodę dostrajania swojego modelu Cosmos Predict 2.5 przy użyciu technik LoRA i DoRA, która pozwala na efektywne generowanie wideo przedstawiającego robotów w akcji. To rozwiązanie zmienia podejście do adaptacji zaawansowanych modeli wizyjnych, bo zamiast retrenigowania całej sieci neuronowej, modyfikuje tylko niewielką liczbę parametrów - dzięki czemu wymaga drastycznie mniej mocy obliczeniowej. Ta dostępność ma znaczenie dla zespołów badawczych i firm pracujących nad robotyką, którym wcześniej takie możliwości były poza zasięgiem finansowym.

Dotychczas dostrajanie dużych modeli generujących wideo wymagało gigantycznych mocy GPU i setek godzin obliczeń. Metoda LoRA-DoRA zmienia tę kalkulację, pozwalając pracować na zwykłych sprzętach bez konieczności posiadania super-komputerów. LoRA (Low-Rank Adaptation) to technika zmniejszająca wymiary przestrzeni parametrów, a DoRA (Domain-Oriented Robust Adaptation) dodaje do niej inteligencję dostosowującą się do specyfiki danej domeny. Razem tworzą lekkie warstwy adaptera, które ingerują w działanie już wytrenowanego Cosmos Predict 2.5, dostosowując go do generowania realistycznych sekwencji robot-centric bez zatracania ogólnych umiejętności modelu.

Praktycznie oznacza to nowe możliwości dla branży automatyzacji i robotyki - firmy mogą teraz szybciej prototypować symulacje działań robotów, testować złożone scenariusze przed wdrożeniem na sprzęcie, czy generować dane treningowe dla systemów autonomicznych. To oszczędza czas i koszty, a jednocześnie przyspiesza innowacje w tym dynamicznie rozwijającym się obszarze. Rozwój ten wpisuje się w szerszą tendencję demokratyzacji narzędzi AI, gdzie skomplikowane zadania stawają się dostępne bez posiadania rzędu miliardów złotych na infrastrukturę.