Vous voulez générer des simulations vidéo interactives à la demande ? Ou transformer une simple photo en monde 3D entièrement explorable ? Deux API viennent de rendre ces deux possibilités accessibles.
Tout d’abord, Odyssey a lancé Odyssey-2 Pro, un modèle du monde qui diffuse des vidéos interactives en temps réel à 720p/22 i/s.
- Saisissez « un bébé qui rit » et il génère une vidéo continue avec laquelle vous pouvez interagir pendant son exécution.
- Envoyez « un chaton apparaît » et la simulation se met instantanément à jour (vous aimez la bouillie de chats générée par l’IA ? Vous allez maintenant avoir droit à de la bouillie de chats interactive !).
- Le modèle prédit l’évolution du monde image par image, en apprenant la physique et les comportements à partir de données vidéo.
- Pour l’instant, il fonctionne pendant quelques minutes ; des sessions de plusieurs heures et de journées entières sont prévues ensuite.
Ensuite, World Labs a lancé son World API quelques jours plus tôt, avec une approche différente :
- Importez n’importe quelle image, vidéo ou instruction textuelle et obtenez un environnement 3D navigable en environ 5 minutes.
- Leur modèle (Marble) génère des mondes complets avec une disposition, une profondeur et un éclairage dans lesquels vous pouvez vous déplacer depuis un navigateur.
- Vous pouvez même exporter ces mondes sous forme de splats gaussiens et de maillages.
Alors, que devient possible avec cette technologie ?
- Jeu vidéo: Escape.ai transforme des films en 2D en espaces 3D explorables. Regardez un film, puis entrez à l’intérieur.
- Robotique: Générez des milliers d’environnements d’entraînement à partir de quelques images, au lieu de construire chacun d’entre eux manuellement. La solution est déjà intégrée à NVIDIA Isaac Sim.
- Architecture: Interior AI visualise instantanément des rénovations. xFigura transforme des croquis en espaces praticables à pied pour les présentations aux clients.
- Éducation: Les étudiants en médecine s’exercent dans des blocs opératoires générés. Les pilotes s’entraînent dans des scénarios générés de manière procédurale. Les secouristes répètent leurs interventions dans des catastrophes simulées.
Les deux API sont tarifées pour permettre l’expérimentation : Odyssey propose des SDK JavaScript et Python (iOS/Android à venir), tandis que World Labs s’intègre aux pipelines 3D standard. Vous pouvez essayer gratuitement Odyssey-2 Pro ici, ou, si vous êtes vous-même développeur, cliquer sur ces liens pour commencer à créer avec leur API pour développeurs ou leur World Labs API.
Pourquoi c’est important: Odyssey a qualifié cela de « moment GPT-2 » pour les modèles du monde, et la comparaison est pertinente : lorsque les API de modèles de langage ont été lancées, personne n’avait prévu l’ascension fulgurante de ChatGPT. La seule limite, en vérité, c’est l’imagination (enfin, l’informatique disponible aussi… mais si l’essor des centres de données est un quelconque indicateur, ce problème se résoudra bientôt de lui-même !)
Note de la rédaction : cet article a été publié à l’origine dans la newsletter de notre publication sœur, The Neuron. Pour découvrir d’autres articles de The Neuron, inscrivez-vous à sa newsletter ici.

