Home Fondamenti Storia dell'AI Reti Neurali Backpropagation Architetture Token Modelli AI Case Studies Tecniche RAG RAG Avanzato GraphRAG MCP Orchestrazione LangChain LangGraph Prompt Engineering Usare l'AI ChipsBot News

Gemini Robotics ER 2: alimentare la robotica con comprensione video, orchestrazione dei compiti e collaborazione multi‑robot

Google DeepMind Blog 20 settembre 2026

Introduzione a Gemini Robotics ER 2

Google ha lanciato Gemini Robotics ER 2, il modello più avanzato finora per la robotica “incarnata”. Si tratta di un “cervello” ad alte prestazioni che consente ai robot di ragionare sullo spazio, pianificare azioni complesse e collaborare in tempo reale con altri robot. Il modello può essere utilizzato tramite Gemini API, Google AI Studio o in anteprima privata sulla Gemini Enterprise Agent Platform, permettendo a sviluppatori e ricercatori di costruire agenti fisici intelligenti su misura.

Caratteristiche principali

Gemini Robotics ER 2 introduce tre innovazioni fondamentali rispetto alla versione precedente (ER 1.6):

    • Comprensione video continua: i robot monitorano il proprio progresso attraverso flussi video in tempo reale, correggendo gli errori al volo.
    • Orchestrazione di compiti a più fasi: il modello pianifica, esegue e verifica sequenze complesse senza pause “stop‑and‑think”.
    • Collaborazione multi‑robot: macchine diverse possono scambiarsi informazioni semantiche e suddividere compiti che nessun singolo robot potrebbe gestire da solo.

Integrazione con strumenti e API

Il modello può chiamare nativamente strumenti come Google Search o funzioni definite dall’utente, e interagire con Vision‑Language‑Action (VLA) models o API di navigazione come parte di un workflow più ampio. Gli sviluppatori dichiarano queste interfacce di controllo a basso livello come “tool” e inviano video, audio o testo multimodale direttamente al modello.

Orchestrazione fluida con Gemini Live API

Per ridurre la latenza, Gemini Robotics ER 2 è integrato nella Gemini Live API, un endpoint di streaming bidirezionale ottimizzato per compiti sensibili al tempo. Ciò consente una orchestrazione continua: il modello invia comandi alle API robotiche, riceve feedback visivo e aggiusta il piano in tempo reale, eliminando i tradizionali ritardi di “pianificazione‑esecuzione‑pianificazione”.

Demo con Spot di Boston Dynamics

Una dimostrazione pratica utilizza il robot quadrupede Spot di Boston Dynamics. Gemini Robotics ER 2 dirige le API di Spot per la navigazione e il movimento del manipolatore, creando un robot capace di recuperare oggetti su comando vocale. Il codice sorgente è disponibile su GitHub insieme ad altri esempi.

Intelligenza temporale per il completamento dei compiti

Una delle sfide più ardue nella robotica è capire quando un compito è terminato. ER 2 introduce due capacità fondamentali:

    • Classificazione del progresso continuo: ogni frame video è assegnato a uno dei cinque livelli di completamento (0‑20 %, 20‑40 %, 40‑60 %, 60‑80 %, 80‑100 %). Il modello raggiunge il 57,4 % di accuratezza, superando le versioni precedenti e i modelli concorrenti.
    • Rilevamento del momento critico: identifica il frame esatto in cui avviene un evento chiave (ad es. quando interrompere il versamento del caffè). L’accuratezza è del 91,3 % con una distanza media di 0,96 s. Nonostante le prestazioni comparabili a modelli di dimensioni molto maggiori, ER 2 offre 4× la velocità di esecuzione e un consumo di calcolo ridotto, garantendo latenza sub‑seconda necessaria per operazioni sicure.

      Collaborazione multi‑robot

      Il modello permette a robot con capacità diverse di cooperare. Ad esempio, il rover a ruote Apptronik Apollo 2 può trasportare carichi pesanti mentre il braccio umanoide Franka F3 Duo esegue manipolazioni di precisione. Entrambi condividono una comprensione semantica comune, consentendo scambi fluidi di compiti e completamento di workflow complessi.

      Miglioramenti dell’intelligenza spaziale

      Gemini Robotics ER 2 avanza la capacità di ragionamento spaziale su tre benchmark chiave:

      • Rilevamento di successo/fallimento: ora opera su flussi video anziché su immagini statiche, individuando errori in tempo reale (versamenti, scivolamenti, allineamenti errati).
      • Lettura di strumenti generici: riconosce quadranti, schermi digitali, scale lineari, righelli e termometri a liquido, testata su 10 tipologie di strumenti.
      • Visual Question Answering spaziale (VQA): migliora la capacità di rispondere a domande visive grazie a una comprensione multimodale più profonda.

    In tutti questi test, ER 2 ottiene l’accuratezza più alta, dimostrando superiorità in rilevamento di successo, QA e lettura di strumenti.

    Sicurezza e intelligenza incarnata

    La sicurezza è una priorità centrale. ER 2 è il modello più sicuro della famiglia Gemini, con miglioramenti marcati nei benchmark di Safety Instruction Following e Human Proximity. Il modello rispetta vincoli fisici durante il ragionamento e rileva la presenza umana, fermando immediatamente un robot umanoide quando rileva un ostacolo umano, riducendo il rischio di incidenti.

    Come accedere e iniziare

    Gli sviluppatori possono utilizzare Gemini Robotics ER 2 attraverso:

      • Gemini API: interfaccia REST per integrazioni personalizzate.
      • Google AI Studio: ambiente visuale per sperimentare prompt e flussi video.
      • Gemini Enterprise Agent Platform: preview privata per soluzioni aziendali scalabili.

    Google fornisce esempi di configurazione, prompt di avvio e script di integrazione per facilitare il passaggio da prototipo a prodotto finale.

    Conclusioni

    Gemini Robotics ER 2 rappresenta una svolta per la robotica autonoma, combinando comprensione video in tempo reale, orchestrazione di compiti complessi e collaborazione multi‑robot. Le sue prestazioni superiori in classificazione del progresso,

Leggi l'articolo originale →
← Torna alle news