Skip to content
research

Les robots de Google peuvent désormais raisonner

Les derniers robots de Google ne se contentent plus d'exécuter des tours préprogrammés ; ils résolvent des problèmes en temps réel. Il ne s'agit pas d'une simple mise à jour incrémentale, mais d'un changement fondamental dans la manière dont les machines interagiront avec notre monde physique.

Aki Tanaka
Les robots de Google peuvent désormais raisonner

Au-delà du salto : l'IA se dote d'un corps

L'intelligence artificielle quitte les écrans numériques pour entrer dans le domaine physique avec le dévoilement de Gemini Robotics 2. Cela marque un changement profond, passant de machines spécialisées effectuant des prouesses impressionnantes comme des saltos, à des robots véritablement généralistes capables de tâches diverses et complexes. La dernière itération de Google met l'accent sur le raisonnement et la résolution de problèmes adaptative, allant au-delà des bras robotiques exécutant des mouvements uniques et préprogrammés.

Gemini Robotics 2 démontre la capacité d'une IA à comprendre son environnement, à prendre des décisions précises et à les traduire en actions physiques coordonnées sur l'ensemble du corps du robot. Contrairement aux robots précédents conçus pour une fonction spécifique, ce système peut s'adapter à des situations inconnues, interagir dynamiquement avec des objets et même coordonner plusieurs robots pour atteindre des objectifs communs. Cela représente un bond en avant vers une véritable intelligence physique, s'attaquant à la « complexité désordonnée de notre environnement humain ».

L'objectif principal de Google est de développer un modèle robotique généralisé unique. Ce modèle peut contrôler divers corps de robots, de la forme humanoïde complète aux mouvements délicats de préhenseurs comme Duo. Le but ultime est de déployer des robots qui reçoivent des instructions de haut niveau, comprennent des objectifs complexes, planifient les mouvements nécessaires complexes et exécutent un large éventail de tâches réelles, apportant ainsi une valeur substantielle dans divers scénarios et réduisant les risques pour les humains.

Le cerveau dans la machine : contrôle du corps entier

Au cœur des robots avancés de Google se trouve le whole-body control, une capacité d'IA sophistiquée semblable à un système nerveux central biologique. Cette intelligence orchestre des milliers de micro-décisions sur toute la forme robotique, coordonnant chaque articulation tout en maintenant un équilibre dynamique. Les humains effectuent sans effort des tâches comme marcher ou saisir, mais pour un robot, cela exige des calculs continus et complexes pour chacune de ses 22 articulations de la main, par exemple, pour réaliser des mouvements simples.

Un composant crucial est le Vision Language Action (VOA) model, qui interprète les commandes en langage naturel en mouvements physiques précis. Ce modèle permet aux robots de comprendre un objectif de haut niveau, de planifier la séquence d'actions nécessaire et de les exécuter avec une dextérité remarquable. Il traduit des instructions orales telles que « préparer le déjeuner » ou « dévisser l'ampoule » en une cascade de commandes motrices granulaires pour tout le corps.

Cela marque un départ significatif de la robotique traditionnelle, qui repose souvent sur des séquences soigneusement préprogrammées ou de simples mouvements de « saisie et placement ». Les anciens systèmes peinent face à la variabilité du monde réel ou aux tâches nécessitant une manipulation complexe, comme faire un nœud ou manipuler des objets délicats. L'approche de Google permet aux robots de s'adapter, de raisonner et d'effectuer des tâches complexes en plusieurs étapes qui étaient auparavant impossibles, dépassant la répétition machinale pour atteindre une véritable intelligence physique.

Le test de dextérité : résoudre des tâches « impossibles »

Le véritable test de l'intelligence physique d'un robot ne réside souvent pas dans des acrobaties spectaculaires, mais dans des tâches que les humains jugent triviales. Le Gemini Robotics 2 de Google a été confronté à des défis tels que fermer un sac Ziploc, visser une ampoule et faire un nœud dans un sac poubelle. Ces actions faussement simples ont longtemps mis les chercheurs en robotique en échec, exigeant un niveau de dextérité jusqu'alors hors de portée.

De telles tâches sont complexes car elles nécessitent une multi-finger coordination complexe, pilotant plus de 22 articulations individuelles dans une seule main robotique simultanément. La manipulation d'objets flexibles, comme un sac en plastique, exige une adaptation constante et une régulation précise de la force, bien au-delà d'une simple opération de type pick-and-place. La forme sphérique d'une ampoule nécessite des points de contact exacts pour la saisie, impliquant des mouvements de torsion, de poussée et de traction.

Maîtriser ces défis représente un bond en avant plus profond pour les robots polyvalents que n'importe quel salto arrière. Cela démontre un fine motor control sophistiqué et une 3D spatial understanding robuste, cruciaux pour interagir de manière sûre et efficace dans des environnements humains. Pour plus de détails techniques sur ces avancées, consultez le Introducing Gemini Robotics ER 2 - Google Blog. Cette précision ouvre la voie à un avenir où les robots pourront accomplir une vaste gamme de tâches pratiques et réelles.

Cet article vous plaît ? Recevez-en un comme celui-ci chaque matin.

un e-mail par jour · désinscription en deux clics · aucun traqueur tiers

Deux robots, un objectif : l'aube du travail d'équipe en IA

La collaboration multi-robots marque un bond significatif, allant au-delà de l'autonomie d'une seule unité. Google l'a démontré avec son robot humanoïde Apollo et le robot à deux bras Duo travaillant ensemble pour organiser un garage. Il ne s'agissait pas d'une seule IA orchestrant deux marionnettes ; au lieu de cela, chaque robot utilise sa propre Gemini stack indépendante, effectuant son propre raisonnement.

Ces robots coordonnent leurs actions en communiquant, en décidant quand s'entraider et même en se transmettant des sous-tâches complexes. Apollo, par exemple, a initié une tâche de rangement de garage, puis a fait appel à Duo pour le kitting précis et l'organisation des outils. Cela orchestre une danse complexe d'intelligences indépendantes, où chaque unité apporte ses capacités uniques.

Cette capacité élargit considérablement l'éventail des tâches que les robots peuvent entreprendre. Un robot peut avoir des difficultés avec un objectif vaste et à plusieurs étapes, mais une équipe coordonnée peut diviser pour mieux régner. Cette fonctionnalité permet aux robots de relever des défis trop complexes pour une seule unité, les poussant vers des applications réelles telles que :

  • L'organisation d'environnements complexes comme des entrepôts ou des maisons
  • La manipulation de matières dangereuses dans des contextes industriels
  • L'exécution de lignes d'assemblage complexes nécessitant plusieurs actions spécialisées

La capacité des robots à raisonner de manière indépendante et à collaborer par la communication ouvre une nouvelle frontière pour la physical AI. Cela signifie que les robots peuvent désormais aborder les problèmes du monde réel avec l'intelligence collective nécessaire pour les résoudre, se rapprochant ainsi d'une assistance véritablement intégrée.

Foire aux questions

Qu'est-ce que Gemini Robotics 2 de Google ?

Il s'agit d'une suite de modèles d'IA avancés de Google conçus pour doter les robots d'un raisonnement, d'une dextérité et d'un contrôle sophistiqués. Elle agit comme le « cerveau » de robots tels que l'humanoïde Apollo, leur permettant d'effectuer des tâches complexes en plusieurs étapes dans le monde réel.

Qu'est-ce qui différencie ces robots des autres ?

La différence clé est la généralité. Au lieu d'être programmés pour une tâche spécifique comme un salto arrière, les robots propulsés par Gemini Robotics 2 peuvent comprendre des commandes de haut niveau, s'adapter à des changements inattendus et effectuer une grande variété de tâches.

Qu'est-ce que le « whole-body control » pour un robot ?

C'est la capacité de coordonner chaque articulation et actionneur — des pieds au bout des doigts — simultanément pour effectuer une tâche tout en maintenant l'équilibre. C'est crucial pour naviguer dans des environnements humains et constitue un défi majeur que Gemini Robotics 2 résout.

Plusieurs robots peuvent-ils travailler ensemble ?

Oui. Une fonctionnalité clé est le raisonnement collaboratif, où plusieurs robots, chacun exécutant son propre modèle Gemini, peuvent se coordonner sur une seule tâche. Ils communiquent et raisonnent de manière indépendante pour répartir le travail et atteindre l'objectif ensemble.

Found this useful? Share it.

For builders

Want Stork to write one of these about your product?

Send us a URL. We use the product, form a view, and publish what we actually think — in 8 languages, labeled Sponsored, with no copy approval on your side. That last part is what makes it worth quoting.

See how it works$500 · AI tools & software only