Google et les robots : le retour du « plan Android »

Il y a des stratégies qui vieillissent bien. Celle qu’a déployée Google avec Android à la fin des années 2000 en fait partie, et Google DeepMind semble décidé à la recycler pour la robotique. C’est en tout cas ce qui ressort de la première grande interview de Koray Kavukcuoglu depuis sa prise de fonction à la tête de Google DeepMind, accordée la semaine dernière à The Information lors de son événement AI Agenda Live.

Le message est clair : là où Figure (soutenue par OpenAI) et Tesla avec Optimus misent sur un humanoïde phare, conçu de bout en bout, Google revendique une approche fondamentalement logicielle. La valeur, selon Kavukcuoglu, se situe dans la couche modèle et non dans le châssis. Interrogé sur la possibilité de voir un jour un humanoïde estampillé Google, il n’a pas fermé la porte. Il ne l’a pas ouverte non plus.

Un air de déjà-vu

La journaliste qui menait l’entretien raconte avoir eu un flashback savoureux. Vers 2007 ou 2008, elle avait posé à Sergey Brin la même question à propos du téléphone. Google travaillait alors avec T-Mobile et HTC sur le premier appareil Android. Réponse de Brin, prononcée en traversant la cafétéria en rollers (on ne réinvente pas la Silicon Valley) : seulement si nous y sommes obligés. On connaît la suite : les Nexus coproduits avec HTC, puis les Pixel conçus en interne. Son pari est donc que Google finira par verticaliser aussi sur les robots, avec un horizon qui pourrait être très lointain.

Pour l’instant, Google applique la première phase du manuel Android : le partenariat. Gemini Robotics est une déclinaison des modèles Gemini adaptée au contrôle physique, et l’objectif est de la faire tourner sur un maximum de robots conçus par d’autres. « Nous essayons de travailler avec d’autres entreprises de robotique pour qu’elles l’utilisent, afin de mettre l’intelligence dans tous les robots, de manière bonne et sûre », résume Kavukcuoglu.

Ce qu’il y a sous le capot

Sur le plan technique, l’architecture est désormais assez lisible. Gemini Robotics repose sur un modèle de type vision-langage-action (VLA), capable de traduire une perception visuelle et une instruction en langage naturel en commandes motrices. Il est épaulé par Gemini Robotics-ER (pour « embodied reasoning »), chargé du raisonnement spatial et de la planification de haut niveau. La logique est celle d’un cerveau à deux étages : l’un réfléchit et découpe la tâche, l’autre exécute.

Le partenaire le plus emblématique est Boston Dynamics. Annoncé en janvier 2026 au CES, l’accord prévoit d’intégrer Gemini Robotics dans la nouvelle génération d’Atlas, en commençant par des usages industriels dans l’automobile, ce qui n’étonnera personne puisque Hyundai est l’actionnaire majoritaire de Boston Dynamics. L’ironie de l’histoire mérite d’être soulignée : Google avait racheté Boston Dynamics en 2013 avant de la revendre à SoftBank en 2017. Revenir par la porte du logiciel après être sorti par celle du matériel, c’est presque une signature maison. DeepMind a d’ailleurs recruté fin 2025 Aaron Saunders, ancien directeur technique de Boston Dynamics, ce qui ressemble moins à un détail qu’à une assurance compétences sur la partie mécanique.

L’argument AGI : un seul modèle pour tout gouverner

Kavukcuoglu relie explicitement cette stratégie à la thèse de Google sur l’intelligence artificielle générale. La même architecture multimodale qui traite le texte, l’image et l’audio est censée se généraliser au monde physique. Détection de piétons, traduction, pilotage de robot : un seul système, plutôt qu’une collection de modèles spécialisés. Et la preuve par l’exemple serait Waymo, que le patron de DeepMind décrit comme « une manière vraiment, vraiment sûre » de démontrer ce que l’IA physique peut faire à grande échelle.

Quelques bémols, quand même

L’analogie avec Android est séduisante, mais elle a ses limites. Un smartphone, c’est un écran, une batterie, un SoC et quelques capteurs : un objet relativement normalisé, sur lequel un OS peut s’imposer. Un robot, c’est une cinématique, des actionneurs, des préhenseurs et des capteurs qui varient d’un constructeur à l’autre. Faire tourner un même modèle sur des corps très différents (ce que les chercheurs appellent le transfert « cross-embodiment ») reste un problème ouvert, même si Google affirme y progresser.

Autre point de vigilance : la donnée. Dans la robotique, la donnée d’interaction physique est rare, coûteuse et largement détenue par ceux qui exploitent les machines. En laissant le matériel aux partenaires, Google se prive en partie de la maîtrise de ce flux. C’est précisément l’argument de Tesla, qui revendique une boucle complète entre ses usines, ses véhicules et Optimus.

Enfin, l’historique de Google en matière de matériel invite à une certaine prudence. Google Glass, la division Everyday Robots fermée en 2023 et absorbée par DeepMind, sans oublier une longue liste de produits retirés : les industriels qui envisagent de bâtir une ligne de production sur un modèle Google voudront des garanties de pérennité, de support et de responsabilité en cas d’incident. Car dans le monde physique, une hallucination ne produit pas une phrase fausse mais un bras robotisé qui se trompe d’objet.

Quant à Waymo, l’exemple est réel et impressionnant, mais il illustre aussi que le passage à l’échelle d’une IA physique a pris plus de quinze ans, avec du matériel très contrôlé et un domaine d’opération progressivement élargi. Ce n’est pas exactement le rythme de déploiement auquel on pense quand on parle de « mettre l’intelligence dans tous les robots ».

Pendant ce temps, côté modèles : Gemini 4 Argon

L’actualité Gemini ne s’arrête pas aux robots. Google a annoncé le 30 septembre Gemini 4 Argon, son nouveau modèle frontière, d’abord réservé à un cercle restreint de défenseurs cyber via le programme Fairwind, avant une diffusion plus large. Google met en avant une fenêtre de contexte d’un million de tokens, de bons résultats en ingénierie logicielle et un tarif d’introduction de 2 dollars par million de tokens en entrée et 10 dollars en sortie. Le choix de servir d’abord les équipes de cyberdéfense, avec des capacités offensives moins bridées pour des profils vérifiés, est révélateur : les modèles frontières sont désormais traités comme des technologies à double usage, à diffuser par paliers. Les prochaines semaines diront si Google a réellement réduit l’écart avec Anthropic et OpenAI.

Ce qu’il faut en retenir

Pour les directions informatiques et les architectes, la leçon dépasse la robotique. Google pousse une plateforme d’intelligence unique, déclinée du texte au code, de la cybersécurité au pilotage de machines. Dans les environnements industriels, cela pose dès maintenant des questions d’architecture très concrètes : exécution embarquée ou dans le cloud, latence, souveraineté des données de production, dépendance à un fournisseur de modèle, et gouvernance de la sécurité fonctionnelle. Le robot humanoïde de Google n’existe peut-être pas encore. Le cerveau, lui, cherche déjà des corps à habiter.

Laisser un commentaire

Ce site utilise Akismet pour réduire les indésirables. En savoir plus sur la façon dont les données de vos commentaires sont traitées.