Le MIT a créé un terrain de jeu virtuel où les robots apprennent à réfléchir

Students working on a robot

Image: Unsplash/ThisisEngineering

Oct 9, 2025
3 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Avant de pouvoir nettoyer votre cuisine, les robots doivent s’y entraîner. Le Massachusetts Institute of Technology (MIT) vient de créer un monde virtuel où ils peuvent s’exercer… sans casser de vaisselle.

Une équipe du Computer Science and Artificial Intelligence Laboratory (CSAIL) du MIT et du Toyota Research Institute a mis au point une nouvelle méthode d’IA appelée « génération de scènes pilotable ». Elle construit rapidement des espaces 3D réalistes — comme des cuisines et des salons virtuels — où les robots peuvent s’entraîner en toute sécurité et à grande échelle.

Au cœur du système se trouve une technique de planification appelée recherche arborescente de Monte-Carlo (MCTS) — la même stratégie qu’emploient des programmes d’IA comme AlphaGo pour examiner de nombreuses possibilités avant de sélectionner la meilleure.

« Nous sommes les premiers à appliquer la MCTS à la génération de scènes en formulant cette tâche comme un processus séquentiel de prise de décision », explique Nicholas Pfaff, doctorant au MIT et auteur principal du projet. « Nous continuons à construire à partir de scènes partielles pour produire au fil du temps des scènes meilleures ou plus souhaitables. Ainsi, la MCTS crée des scènes plus complexes que celles sur lesquelles le modèle de diffusion a été entraîné. »

Les robots ont besoin de cette complexité. Alors que les chatbots apprennent à partir de milliers de milliards de mots, les robots dépendent de démonstrations visuelles et physiques réalistes — des données qu’il est long et coûteux de créer manuellement. Le nouveau système automatise ce processus grâce à un modèle d’IA générative qui peut être « piloté » pour construire des scènes détaillées et physiquement exactes.

Lors d’un test, cette approche a permis à l’IA de garnir une table de restaurant virtuelle de 34 éléments, dont de hautes piles de plats de dim sum, alors qu’elle n’avait été entraînée que sur des scènes comptant en moyenne 17 objets.

Bien plus que de jolies images

Au-delà de la simple création d’images, le système comprend également la logique physique.

Il veille par exemple à ce qu’une fourchette ne traverse pas un bol en flottant dans les airs et à ce qu’une tasse repose fermement sur une table. Les utilisateurs peuvent saisir des commandes comme « une cuisine avec quatre pommes et un bol sur la table », et l’outil donne vie à cette scène avec une précision impressionnante — 98 % pour les scènes de garde-manger et 86 % pour les tables de petit-déjeuner en désordre, selon les chercheurs.

Pour Pfaff, la véritable avancée réside dans la flexibilité de l’outil.

« L’une des conclusions importantes de nos travaux est qu’il n’est pas nécessaire que les scènes sur lesquelles nous avons effectué le préentraînement ressemblent exactement à celles que nous voulons réellement obtenir, a-t-il expliqué. Grâce à nos méthodes de pilotage, nous pouvons dépasser cette vaste distribution et échantillonner à partir d’une distribution “meilleure”. »

Les experts du secteur y voient un fort potentiel

Advertisement

Des experts qui n’ont pas participé au projet ont salué cette approche.

Jeremy Binagia, spécialiste des sciences appliquées chez Amazon Robotics, a déclaré à MIT News que la « génération de scènes pilotable » offrait « une meilleure approche » des simulations réalistes, car elle garantit l’exactitude physique et la compréhension de la 3D, deux aspects qui faisaient défaut à la plupart des modèles précédents.

Rick Cory, roboticien au Toyota Research Institute, a ajouté que ce cadre pouvait créer des scènes « jamais vues auparavant », importantes pour entraîner des robots capables de s’adapter à de nouvelles situations.

Bien que le projet n’en soit encore qu’au stade de la preuve de concept, l’équipe du MIT espère aller plus loin. Elle prévoit d’utiliser l’IA générative pour inventer entièrement de nouveaux objets et créer des environnements plus dynamiques, avec des éléments mobiles comme des placards, des bocaux et des tiroirs.

À terme, elle souhaite combiner sa technologie avec des données d’images à l’échelle d’Internet afin de construire une plateforme mondiale d’entraînement des robots, qui reproduirait la diversité de la vie réelle.

Pour découvrir comment Google fait progresser l’intelligence des robots, lisez comment Gemini 1.5 change la donne.

Aminu Abdullahi

Aminu Abdullahi is a B2C and B2B technology and finance writer with more than six years of experience covering enterprise IT, cybersecurity, cloud computing, artificial intelligence, fintech, business software, and emerging technologies. His work has appeared in publications including TechRepublic, eWEEK, Channel Insider, Geekflare, Enterprise Networking Planet, eSecurity Planet, CIO Insight, and Webopedia. With a technical background in computer science, he specializes in translating complex technology topics into clear, accessible content for business leaders and decision-makers.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.