Google DeepMind ha alzato il tiro sulla robotica intelligente con Gemini Robotics 2, l'infrastruttura software che fa dialogare e cooperare robot di forma e natura diversa sullo stesso flusso di lavoro. La novit� pi� concreta riguarda la collaborazione multi-robot: due macchine - per esempio un umanoide e un robot a due braccia - possono spartirsi un compito che nessuna delle due porterebbe a termine da sola, comunicando e coordinandosi in tempo reale.
Il pacchetto si articola in tre modelli distinti. C'� Gemini Robotics 2, un modello vision-language-action (VLA) che traduce ci� che il robot vede e sente in comandi motori, arrivando a governare umanoidi completi e piattaforme a doppio braccio. Sopra di esso lavora Gemini Robotics ER 2, un modello vision-language che ragiona sull'ambiente, pianifica sequenze lunghe minuti e fa da regista, superando - secondo Google - i modelli di frontiera concorrenti della sua categoria. Il terzo, Gemini Robotics On-Device 2, gira in locale sul dispositivo, senza bisogno di connessione.
Gemini Robotics ER 2 � gi� accessibile su Google AI Studio e in private preview sulla Gemini Enterprise Agent Platform, mentre i modelli VLA e On-Device restano riservati ai partner in accesso anticipato. ER 2 funziona come il cervello di alto livello dell'insieme. Osserva la stanza, scompone l'istruzione dell'utente in passaggi, passa le azioni al VLA e tiene traccia dei progressi fino alla fine. La differenza rispetto al passato sta nella tenuta sulle sequenze lunghe: il modello gestisce ora centinaia di decisioni distribuite su compiti che durano diversi minuti, capisce quando un'operazione inizia e finisce, e sa correggersi se un passaggio va storto.











