Google a présenté Gemini Omni, une nouvelle famille de modèles d’IA multimodaux annoncée lors de Google I/O 2026, en la présentant comme une avancée majeure vers la conception de systèmes capables de « créer n’importe quoi à partir de n’importe quelle entrée ».
Le premier modèle de cette gamme est Gemini Omni Flash, déjà en cours de déploiement sur les plateformes grand public de Google, notamment l’application Gemini, Google Flow et YouTube Shorts.
Si Google a déjà exploré la génération de vidéos par IA avec des outils comme Veo et des systèmes de génération d’images tels que Nano Banana, Omni va plus loin en réunissant le raisonnement, la création et le montage au sein d’un même système.
Le PDG de Google, Sundar Pichai, a déclaré lors d’une réunion d’information avec les médias que Gemini Omni représente un changement majeur de paradigme technologique. « Avec les modèles du monde, l’IA passe de la prédiction de texte à la simulation de la réalité. Gemini Omni est l’étape suivante dans cette direction », a déclaré Pichai.
La technologie y parvient en s’appuyant sur une compréhension intuitive des forces physiques telles que la gravité, l’énergie cinétique et la dynamique des fluides, tout en puisant dans la vaste base de connaissances de Gemini sur l’histoire, les sciences et le contexte culturel.
Montage vidéo conversationnel
Au-delà de la création de vidéos à partir de rien, Gemini Omni introduit un montage vidéo très performant entièrement piloté par le langage naturel. Au lieu d’utiliser un logiciel de montage vidéo traditionnel et complexe, les utilisateurs peuvent modifier leurs vidéos au fil de plusieurs échanges conversationnels, tandis que l’IA préserve la cohérence des personnages, la continuité des scènes et les lois de la physique.
Selon Google, les utilisateurs peuvent repenser entièrement l’action d’une scène, remplacer les arrière-plans, modifier les angles de caméra ou changer certains détails sans perdre le fil des séquences originales. Google a toutefois averti que les prompts de montage doivent actuellement être très précis. Si un prompt est trop vague, le modèle risque de modifier excessivement la vidéo ou d’altérer involontairement des éléments que l’utilisateur souhaitait conserver.
Avatars numériques et garde-fous
Le déploiement comprend une fonctionnalité d’avatar numérique personnalisé qui permet aux utilisateurs de générer des représentations vidéo d’eux-mêmes leur ressemblant et reproduisant leur voix.
Pour répondre aux inquiétudes liées aux hypertrucages et protéger les utilisateurs contre les préjudices, Nicole Brichtova, directrice de la gestion des produits chez Google DeepMind, a précisé que les utilisateurs doivent suivre un processus d’intégration dédié. Ils doivent notamment s’enregistrer en train de prononcer une série de chiffres avant qu’un avatar puisse être créé et enregistré.
Parce que la capacité d’Omni à modifier la réalité de manière transparente présente des risques potentiels, Google intègre son filigrane numérique imperceptible SynthID à chaque vidéo générée par le modèle. Ces filigranes peuvent être vérifiés dans l’application Gemini, Google Search et Chrome afin de garantir la transparence des contenus.
L’entreprise adopte également une approche prudente concernant le montage audio. Si les utilisateurs peuvent créer des avatars avec leur propre voix, les fonctionnalités plus avancées permettant de modifier la parole et les éléments audio ne sont pas encore proposées au public, Google poursuivant ses tests et ses évaluations de sécurité.
Prix et disponibilité
Le premier modèle du nouvel écosystème à être lancé est Gemini Omni Flash, qui se concentre sur le rendu de clips vidéo de 10 secondes.
Google a expliqué que la limite de 10 secondes ne constitue pas une limitation technique du modèle, mais une décision délibérée destinée à faciliter le déploiement de l’outil auprès d’un large public.
- Abonnés payants : Gemini Omni Flash est immédiatement déployé auprès des abonnés Google AI Plus, Pro et Ultra dans l’application Gemini et Google Flow.
- Utilisateurs gratuits : Le modèle est lancé gratuitement sur YouTube Shorts et l’application YouTube Create.
- Développeurs et entreprises : L’accès via des API sera ouvert dans les prochaines semaines.
Le prochain test pour Gemini Omni consistera à déterminer si les utilisateurs le considéreront comme un raccourci créatif, un outil de montage vidéo ou quelque chose de plus proche d’une plateforme de médias synthétiques. Google présente le modèle comme une étape vers une IA capable de comprendre le monde physique, mais son impact plus large pourrait tout autant dépendre de la capacité de ses garde-fous à suivre le rythme de ce que les utilisateurs créent.
À lire également : Gemini 3.5 Flash intègre le dernier modèle d’IA de Google au codage, à la recherche, à l’automatisation des entreprises et aux agents d’IA personnels.


