Google DeepMind wypuścił Gemini Robotics 2 - inteligentną warstwę dla następnej generacji robotów, którą stanowią trzy odrębne modele dostępne na trzech poziomach dostępu. System przechodzi poza manipulację na stołem w kierunku pełnej kontroli ciała, sterowania pięciopalczastymi rękami i współpracy między wieloma robotami.
Gemini Robotics 2 to model vision-language-action (VLA), który konwertuje sygnały wizyjne i polecenia językowe bezpośrednio na rozkazy motoryczne. Jeden checkpoint napędza robota Apollo 2 z dwiema różnymi rękami oraz gripper Franka Duo. Obok niego pojawia się Gemini Robotics ER 2 - model embodied reasoning będący zaawansowanym VLM, który pełni rolę wysokopoziomowego mózgu robota, planując zadania i komunikując się z operatorami. Trzeci komponent to on-device VLA, model działający bezpośrednio w robocie.
Dotychczasowe rozwiązania opierały się na wstępnym programowaniu lub teleoperacji dla wąskich, powtarzalnych sekwencji zadań, bez adaptacji do nieprzewidywalnych środowisk i słabym transferem umiejętności między różnymi robotami. Gemini Robotics 2 ma rozwiązać wszystkie trzy problemy jednocześnie. Google DeepMind opublikował też nowy benchmark bezpieczeństwa ASIMOV-Agentic na platformie Hugging Face. Słabym punktem pozostaje multi-finger dexterity ze wskaźnikami sukcesu między 32% a 92%, ale to znaczący postęp w drodze do bardziej autonomicznych i adaptacyjnych robotów.