Netflix ne se contente plus de diffuser des films : l’entreprise cherche désormais à changer la manière dont ils sont réalisés.
L’entreprise a récemment présenté un nouveau framework d’IA appelé VOID, acronyme de Video Object and Interaction Deletion. Si nous avons déjà vu des gommes magiques pour les photos, l’outil de Netflix va beaucoup plus loin : il ne se contente pas de supprimer un objet ; il recalcule l’ensemble de la scène pour tenir compte de l’absence de cet objet.
La plupart des outils de montage par IA se contentent de combler le trou laissé lorsqu’on supprime quelque chose. Si vous retirez une voiture d’un accident, ces outils peuvent laisser un flou étrange ou des débris en suspension. VOID est différent, car il comprend les relations de cause à effet et la physique.
Si vous utilisez VOID pour supprimer une personne plongeant dans une piscine, l’IA ne fait pas que la faire disparaître ; elle « réimagine » l’eau afin qu’il n’y ait absolument aucune éclaboussure. Selon The Register, les chercheurs ont décrit VOID dans un article en prépublication comme « un framework de suppression d’objets vidéo conçu pour effectuer une complétion physiquement plausible dans ces scénarios complexes ».
Lors d’un autre test, lorsqu’une voiture est retirée d’une collision frontale, l’IA calcule une trajectoire pour la voiture restante, comme si l’accident n’avait jamais eu lieu. La fumée, le feu et les débris sont remplacés par une route propre et intacte.
Construit sur un ensemble de technologies d’IA
VOID n’est pas un système autonome, mais une combinaison de plusieurs modèles d’IA avancés et jeux de données.
Selon The Decoder, le framework repose sur le modèle de diffusion CogVideoX d’Alibaba et utilise des données d’entraînement synthétiques issues de Kubric, de Google, et de HUMOTO, d’Adobe. Parmi les outils supplémentaires figurent Gemini 3 Pro de Google pour l’analyse des scènes et SAM2 de Meta pour la segmentation des objets.
Une deuxième étape de traitement facultative utilise des techniques de flux optique pour corriger les distorsions et améliorer la cohérence visuelle.
Les outils concurrents et les affirmations de Netflix
Il existe déjà des outils dans ce domaine, notamment Runway, ProPainter, DiffuEraser et Generative Omnimatte. Mais les chercheurs de Netflix affirment que VOID offre de meilleurs résultats dans les scénarios complexes.
Lors d’une petite étude interne menée auprès de 25 participants, VOID a été préféré dans 64,8 % des cas, contre 18,4 % pour Runway.
« Grâce à de nombreuses évaluations… nous montrons que VOID excelle dans la modélisation de dynamiques complexes pouvant découler de la suppression d’objets », ont écrit les chercheurs.
Netflix a rendu VOID accessible au public sous licence Apache 2.0 via des plateformes comme Hugging Face et GitHub. Les développeurs, les studios et les chercheurs peuvent donc l’expérimenter librement, y compris pour un usage commercial.
Cependant, l’outil est loin d’être léger. Son exécution nécessite du matériel haut de gamme, notamment des GPU dotés d’environ 40 Go de VRAM, ce qui le met hors de portée de la plupart des utilisateurs occasionnels.
À lire aussi : les meilleurs outils de retouche photo par IA en 2026 montrent à quelle vitesse les fonctions de nettoyage par IA passent de simples corrections d’image à des workflows de retouche visuelle plus avancés.

