Le 30 juillet 2026, Google DeepMind a publié Gemini Robotics ER 2 — un modèle d'embodied reasoning pensé comme cerveau de haut niveau pour robots. D'après l'annonce officielle, il lit le monde physique, planifie des tâches multi-étapes, orchestre des outils (VLA, APIs de navigation, fonctions définies par l'utilisateur, jusqu'à Google Search) et collabore entre machines. Le signal pour les builders n'est pas un teaser de lab : le modèle est déjà joignable via la Gemini API, Google AI Studio, et en private preview sur la Gemini Enterprise Agent Platform.
Où se trouve vraiment le marché aujourd'hui
Jusqu'ici, l'IA robotique se heurtait à un goulot précis : raisonner trop lentement pour le monde physique. ER 2 bascule ce cadre. Selon le billet développeur Google, le modèle s'intègre à la Gemini Live API via un endpoint de streaming bidirectionnel optimisé pour la latence, afin d'ordonner des modèles d'action et des APIs robotiques sans les pauses « stop-and-think » qui cassent une boucle réelle.
Sur l'orchestration d'outils, Google DeepMind indique que ER 2 surpasse systématiquement ER 1.6 sur trois modes de contrôle : VLA réel, VLA en simulation, et téléopération humaine. Une démo citée orchestre les Spot APIs de Boston Dynamics (navigation, bras) pour qu'un Spot aille chercher un snack sur commande en langage naturel — le code d'exemple est publié sur GitHub d'après l'annonce.
Deux chiffres de temporal intelligence ancrent le présent. Sur la classification de progression (cinq bandes 0–20 % … 80–100 % par frame vidéo), ER 2 atteint 57,4 % de précision selon les évaluations publiées. Sur le moment-finding (cadrer la frame exacte d'un événement critique — arrêter de verser le café), il affiche 91,3 % de précision et un écart absolu moyen de 0,96 s, avec une vitesse d'exécution annoncée 4× supérieure dans la catégorie de comparaison de Google — le seuil sub-seconde que la physique exige.
La collaboration multi-robots n'est plus un slide. L'annonce décrit des machines hétérogènes — l'humanoïde Apptronik Apollo 2 et le Franka F3 Duo — qui se coordonnent via une compréhension sémantique partagée pour enchaîner des workflows qu'un seul corps ne tient pas.
Trois trajectoires hautement probables d'ici 12 mois
Horizon borné : mi-2027. Ce qui suit distingue le hautement probable, le plausible et le spéculatif.
1. L'agent ER devient la couche de contrôle par défaut
Hautement probable. Avec l'API publique et les samples GitHub, les stacks builders basculent d'un script monolithe « perception → policy » vers un schéma déclaré : VLA et navigation exposés comme tools, flux multimodal vidéo/audio/texte injecté en continu dans ER 2. La séparation cerveau (ER) / muscles (VLA) se normalise.
2. Le multi-robot quitte la démo pour la cellule de lab
Plausible à hautement probable dans les labs équipés. Une fois le handoff sémantique entre morphologies validé en atelier, les cellules de R&D enchaînent rover + bras + humanoïde sur le même objectif. Ce n'est pas encore l'usine entière ; c'est le passage de la démo isolée à la workflow multi-corps instrumentée.
3. La sécurité agentique devient un gate de déploiement
Hautement probable. Google présente ER 2 comme son modèle robotique le plus sûr à ce jour sur les benchmarks Safety Instruction Following et Human Proximity : détection de proximité humaine, arrêt sûr, reprise seulement quand la zone est libre. Un rapport technique de sécurité accompagne la sortie. D'ici 12 mois, les équipes qui ne mesurent pas l'orchestration sûre d'un VLA se feront coller aux gates internes — et aux standards collaboratifs cités par Google.
Trois capacités à verrouiller ce trimestre
- Streaming Live + outils déclarés. Brancher ER 2 sur la Gemini Live API, déclarer au moins un VLA (réel ou sim) et une API de navigation comme tools, et mesurer la latence bout-en-bout sur une tâche multi-étapes de plusieurs minutes — le régime que l'annonce cible explicitement.
- Progress classification + moment-finding en boucle fermée. Logger les bandes de progression 0–100 % et les frames d'événements critiques. Sans ces deux signaux, l'auto-correction annoncée (retry d'une étape sans tout rejouer) reste du marketing interne.
- Success/failure sur flux vidéo brut. ER 2 étend la détection d'échec aux feeds continus (déversements, glissements, désalignements) et généralise la lecture d'instruments à 10 types (cadrans, échelles, afficheurs numériques, thermomètres liquides). C'est la télémétrie de terrain, pas un score hors ligne.
Trois risques à mitiger maintenant
- Surconfiance sur le 57,4 %. La classification de progression progresse, mais 57,4 % d'après les évaluations publiées n'est pas un plafond de production. Construire des garde-fous humains quand la bande de progression stagne ou régresse.
- Hétérogénéité morphologique mal instrumentée. Le multi-robot suppose un vocabulaire d'objectifs partagé. Sans contrats d'interface clairs (état, succès, refus), le handoff Apollo ↔ Franka devient un chaos de retries.
- Sécurité traitée après le démo-day. L'annonce insiste sur l'arrêt autonome en proximité humaine. Si le stack VLA peut encore appeler un outil dangereux sans veto ER, le modèle le plus sûr du catalogue ne sauve rien. Mettre le refus d'outil et l'escalade humaine dans le chemin critique dès le premier prototype.
Trois leviers à activer cette semaine
- Ouvrir un prompt ER 2 dans Google AI Studio (modèle
gemini-robotics-er-2-previewd'après le parcours d'accès annoncé) et rejouer le notebook Getting Started publié par Google. - Cloner les samples Live API du dépôt robotics GitHub et brancher une boucle Spot-style (navigation + manipulateur) en simulation ou sur hardware partenaire si disponible.
- Rédiger une checklist de gate calquée sur les axes de sécurité cités : contraintes physiques, monitoring d'environnement, faisabilité de la tâche, demande de clarification humaine — avant d'augmenter le rythme des appels d'outils.
Dans 12 mois, ton lab robotique orchestre-t-il encore des scripts isolés — ou un cerveau ER partagé entre corps hétérogènes ?
Si tu kiffes les nouvelles tech IA, je publie chaque jour une analyse pointue sur les LLMs, le hardware, la robotique, les automatisations et la musique générée par IA. 👉 Reçois la prochaine directement dans ta boîte mail — l'inscription prend dix secondes.