Un nouvel outil d’intelligence artificielle, Mirage, peut transformer des vidéos en direct en temps réel. Avec un simple prompt textuel, les utilisateurs peuvent modifier le style visuel de leur flux pour lui donner une apparence d’anime ou de cyberpunk.
Mirage est le produit de la start-up israélienne Decart, qui affirme être le « premier système capable de générer des vidéos infinies en temps réel, sans latence ». Il repose sur MirageLSD, le modèle vidéo d’IA par diffusion de l’entreprise pour les flux en direct, qui génère 20 images par seconde dans une résolution de 768×432.
« La génération en temps réel exige que chaque image soit produite en moins de 40 millisecondes pour ne pas être perceptible par l’œil humain », a écrit l’équipe de Decart dans un article de blog.
Les démonstrations vidéo de Decart montrent son IA transformer une partie de Minecraft en paysage enneigé, plonger les joueurs de Call of Duty dans une prairie paisible bordée d’arbres roses, et réinventer « What Makes You Beautiful » de One Direction dans différents styles d’anime. Chaque image est générée séquentiellement, à partir d’un prompt textuel et de l’image précédente, selon une approche dite causale et autorégressive.
L’outil pourrait aisément être utilisé pour le streaming en direct sur des plateformes comme Discord ou TikTok, pour les appels vidéo, ainsi que pour la lecture classique d’émissions télévisées, de films et de clips préenregistrés. Decart espère prendre en charge prochainement la Full HD et la 4K.
Comment la transformation vidéo par IA en temps réel a été rendue possible
Les outils d’IA concurrents de transformation vidéo-à-vidéo ont eu du mal à gérer les diffusions en direct, principalement à cause des modèles autorégressifs qu’ils utilisent. Chaque nouvelle image est générée à partir des informations contenues dans les images précédentes, ce qui signifie qu’elle hérite de toutes leurs erreurs. Après environ 30 secondes de séquence, ces erreurs cumulées dégradent fortement la qualité de la vidéo.
Mirage remédie au problème grâce à deux innovations. Premièrement, la diffusion forcée entraîne le modèle à nettoyer les images bruitées sans avoir besoin du contexte complet, ce qui permet une génération précise image par image. Deuxièmement, l’augmentation de l’historique lui apprend à reconnaître et à corriger les erreurs issues de ses propres résultats précédents. Il apprend ainsi à faire de même pendant la génération et à éviter une dégradation progressive de la qualité au fil du temps.
Les outils classiques d’IA de transformation vidéo-à-vidéo sont également souvent lents : ils nécessitent plusieurs minutes de traitement pour seulement quelques instants de résultat. Avec Mirage, le délai entre l’entrée et la sortie n’est que d’environ 100 millisecondes, traitement et autres surcoûts du système compris.
Decart y est parvenu en réduisant le nombre d’étapes nécessaires à la génération de chaque image et en allégeant le modèle pour le rendre plus efficace. Le système est spécialement optimisé pour les puces NVIDIA Hopper grâce à un code GPU personnalisé de bas niveau, ce qui accélère le traitement et réduit la latence.
Les streamers qui utilisent des outils comme Mirage pour transformer leurs vidéos YouTube en temps réel n’ont pas à s’inquiéter : la plateforme affirme que les contenus générés par IA sont acceptés à condition qu’ils ne soient pas « inauthentiques ».

