Google DeepMind opracował Gemini Robotics 2 - system AI zdolny do inteligentnego sterowania całym robotem na podstawie instrukcji tekstowych. Model łączy wizyjne rozumienie sceny z kontrolą precyzyjnych ruchów robota, umożliwiając autonomiczne wykonywanie skomplikowanych zadań manipulacyjnych bez potrzeby programowania poszczególnych gestów.
Gemini Robotics 2 stanowi ewolucję podejścia do robotyki opartego na dużych modelach multimodalnych. Zamiast uczyć robota każdego ruchu osobno, system integruje zdolności rozumienia języka naturalnego z rzeczywistą kontrolą motoryczną. Robot może interpretować polecenia słowne, analizować otoczenie kamerą i automatycznie dostosowywać swoje ruchy do konkretnej sytuacji.
To osiągnięcie ma znaczące implikacje dla przyszłości automatyzacji przemysłowej i usług. Systemy takie mogą zrevolutionizować sposób, w jaki roboty współpracują z ludźmi i wykonują zadania wymagające adaptacji do zmiennych warunków. Podejście oparte na modelach fundacyjnych może przyspieszyć wdrażanie robotyki w sektorach takich jak produkcja, logistyka czy opieka zdrowotna.