La gamme d’IA de Google est devenue un potage de lettres, agrémenté d’une touche fruitée.
Gemini prend en charge la rédaction, la recherche, le codage et d’autres tâches générales. Veo génère des vidéos. Nano Banana crée et retouche des images à l’aide de Gemini, tandis qu’Imagen reste la famille spécialisée de Google pour la génération d’images à partir de texte. Google propose également des modèles distincts pour la musique, la parole, les appareils mobiles et les applications personnalisées.
Les noms peuvent finir par se confondre, mais la structure de base est simple : Google utilise différentes familles de modèles d’IA pour différentes tâches.
- Gemini : la famille d’IA phare de Google
- Veo : la génération vidéo par IA
- Imagen : la famille spécialisée de Google pour la génération d’images à partir de texte
- Nano Banana : la création et la retouche d’images basées sur Gemini
- Gemma : des modèles ouverts pour les développeurs
- Lyria : la génération musicale par IA
- Chirp : reconnaissance vocale et transcription
- Gemini Nano : une IA qui s’exécute sur l’appareil
- Google AI Studio et Gemini Enterprise sont des plateformes
- Quel modèle d’IA de Google devez-vous utiliser ?
Gemini : la famille d’IA phare de Google
Gemini est la principale famille de modèles d’IA multimodaux de Google. Les modèles multimodaux peuvent traiter plusieurs types d’informations, notamment du texte, des images, de l’audio, de la vidéo et du code.
Les utilisateurs peuvent accéder à Gemini via l’application Gemini, Google Workspace, la recherche Google, Android, Google AI Studio et les produits d’IA de Google destinés aux entreprises.
Google propose plusieurs modèles Gemini optimisés pour différentes charges de travail. Les modèles Pro privilégient généralement les tâches de raisonnement et de codage plus exigeantes, tandis que les modèles Flash et Flash-Lite mettent l’accent sur la rapidité, l’efficacité et un traitement moins coûteux. Gemini Nano est conçu pour certaines fonctionnalités exécutées directement sur l’appareil.
Les noms exacts des modèles évoluent au fil des nouvelles générations lancées par Google. Les entreprises doivent donc consulter le catalogue actuel des modèles de Google avant d’en choisir un pour une application.
Idéal pour : la rédaction, la recherche, le codage, l’analyse, les agents et les applications multimodales.
Veo : la génération vidéo par IA
Veo est la famille de modèles vidéo génératifs de Google DeepMind.
Il peut créer des vidéos à partir de consignes écrites et d’images de référence, en interprétant des instructions concernant les mouvements de caméra, le style visuel, l’éclairage, le décor et l’action. Google présente Veo comme un outil destiné aux créateurs, aux cinéastes, aux équipes marketing et aux développeurs qui conçoivent des outils vidéo.
Les entreprises qui envisagent d’utiliser Veo doivent évaluer davantage que la seule qualité visuelle. Les coûts de génération, la cohérence de la marque, les questions de droits d’auteur et les obligations de signalement des contenus synthétiques peuvent également influer sur les usages possibles du modèle.
Idéal pour : les clips marketing, les storyboards, les vidéos conceptuelles et les prototypes créatifs.
Imagen : la famille spécialisée de Google pour la génération d’images à partir de texte
Imagen est la famille spécialisée de modèles de Google pour la génération d’images à partir de texte.
Elle crée des images à partir de descriptions écrites et prend en charge des tâches telles que la production d’illustrations, de concepts publicitaires, de visuels de présentation et de maquettes de produits.
Google a abandonné les points d’accès pour développeurs d’Imagen 4 en juin 2026 et recommande désormais les modèles d’image basés sur Gemini pour les nouveaux projets de développement. Google répertorie toutefois toujours Imagen parmi les modèles d’IA spécialisés de son portefeuille global.
Pour la plupart des nouveaux déploiements, les entreprises doivent comparer les options d’image Gemini actuellement proposées par Google avant de choisir un modèle d’image.
Idéal pour : la génération d’images à partir de texte et l’étude de l’évolution du portefeuille de modèles d’image de Google.
Nano Banana : la création et la retouche d’images basées sur Gemini
Nano Banana est la famille actuelle de modèles de génération et de retouche d’images de Google, conçue à partir de Gemini.
Ces modèles s’appuient sur les capacités de compréhension linguistique et multimodale de Gemini pour suivre des instructions détaillées, utiliser des images importées et affiner les résultats au fil d’une conversation. L’utilisateur peut demander à Nano Banana de remplacer un arrière-plan, de supprimer un objet, de modifier des vêtements, d’ajuster l’éclairage ou de conserver un personnage cohérent dans plusieurs images.
La famille actuelle de Google comprend Nano Banana Pro, Nano Banana 2 et Nano Banana 2 Lite. Les variantes diffèrent par leurs capacités, leur rapidité et leur coût. Nano Banana Pro privilégie la précision et le contrôle, tandis que Nano Banana 2 et 2 Lite misent sur une génération plus rapide et plus efficace.
Imagen et Nano Banana appartiennent à des familles de modèles distinctes. Imagen est la technologie spécialisée de Google pour la génération d’images à partir de texte, tandis que Nano Banana est basé sur Gemini et met l’accent sur la génération et la retouche d’images multimodales et conversationnelles.
Idéal pour : la création et la retouche d’images, la conception itérative, les visuels pour les réseaux sociaux et la cohérence des personnages.
Gemma : des modèles ouverts pour les développeurs
Gemma est la famille de modèles ouverts de Google destinée aux développeurs et aux chercheurs.
Contrairement aux modèles Gemini, auxquels les utilisateurs accèdent généralement via les produits ou les interfaces de programmation d’applications de Google, les modèles Gemma peuvent être téléchargés et adaptés à des environnements informatiques compatibles. Les organisations bénéficient ainsi d’un meilleur contrôle sur le déploiement et la personnalisation.
Cette flexibilité implique toutefois du travail supplémentaire. Les équipes doivent elles-mêmes gérer l’infrastructure, la sécurité, les tests, les mises à jour et les garde-fous du modèle.
Idéal pour : les applications personnalisées, les déploiements locaux, la recherche et l’expérimentation par les développeurs.
Lyria : la génération musicale par IA
Lyria est la famille de modèles de génération musicale de Google DeepMind.
Son modèle phare actuel, Lyria 3, peut créer des morceaux haute fidélité d’une durée maximale de trois minutes. Les utilisateurs peuvent préciser les genres, les instruments, les styles vocaux, les paroles, le tempo et d’autres détails musicaux. Le modèle peut également s’inspirer d’une image importée pour créer un morceau.
Google propose également Lyria RealTime, conçu pour la génération musicale interactive plutôt que pour produire un morceau final à partir d’une seule consigne.
Idéal pour : les expérimentations musicales, les bandes-son, les concepts audio et la composition interactive.
Chirp : reconnaissance vocale et transcription
Chirp est la famille de modèles de Google spécialisée dans la parole.
Les entreprises peuvent utiliser Chirp pour la reconnaissance vocale, la transcription, le sous-titrage, les interfaces vocales et l’analyse des appels clients. On y accède généralement via les services Google Cloud plutôt que par une application grand public autonome.
Les performances peuvent varier selon le bruit de fond, les accents, le vocabulaire technique, les conversations simultanées et la qualité de l’enregistrement.
Idéal pour : la transcription, le sous-titrage, la reconnaissance vocale et les applications vocales.
Gemini Nano : une IA qui s’exécute sur l’appareil
Gemini Nano est conçu pour exécuter certaines charges de travail d’IA directement sur les appareils compatibles.
Le traitement sur l’appareil peut réduire la latence, limiter la dépendance à une connexion Internet et offrir des avantages en matière de confidentialité, puisque certaines informations peuvent être traitées localement. Les modèles Nano sont plus petits que les principaux modèles Gemini de Google basés dans le cloud ; ils sont donc particulièrement adaptés à des fonctions ciblées comme le résumé, les réponses suggérées, l’assistance à la transcription et d’autres fonctionnalités mobiles.
La disponibilité dépend de l’appareil, du système d’exploitation et de la fonctionnalité concernée.
Idéal pour : l’IA mobile, les fonctionnalités hors ligne, le traitement à faible latence et certaines tâches sensibles en matière de confidentialité.
Google AI Studio et Gemini Enterprise sont des plateformes
Google AI Studio et la plateforme d’IA de Google destinée aux entreprises sont souvent mentionnés aux côtés de ses modèles, mais ce ne sont pas des modèles individuels. Google AI Studio permet aux développeurs de tester des invites, d’explorer les modèles pris en charge et de créer de premiers prototypes.
Gemini Enterprise Agent Platform est l’environnement d’IA de Google Cloud destiné aux entreprises. Il fournit aux organisations des outils pour accéder aux modèles, créer des agents, gérer les données, évaluer les performances et déployer des applications d’IA.
Google intègre désormais les services de Vertex AI à Gemini Enterprise Agent Platform.
Pour retenir simplement la différence, les modèles effectuent le travail d’IA, tandis que les plateformes fournissent les outils nécessaires pour y accéder, les gérer et les déployer.
Quel modèle d’IA de Google devez-vous utiliser ?
Le bon choix dépend de la tâche :
- Utilisez Gemini pour la rédaction, la recherche, le codage, le raisonnement et les agents.
- Utilisez Veo pour la génération vidéo.
- Utilisez Nano Banana pour les projets actuels de création et de retouche d’images.
- Utilisez Gemma lorsque le contrôle du déploiement et la personnalisation sont importants.
- Utilisez Lyria pour la génération musicale.
- Utilisez Chirp pour la reconnaissance vocale et la transcription.
- Utilisez Gemini Nano pour les fonctionnalités compatibles exécutées sur l’appareil.
- Utilisez Google AI Studio pour les tests et le prototypage.
- Utilisez Gemini Enterprise Agent Platform pour le développement et le déploiement en entreprise.
Les entreprises doivent également comparer les coûts, la sécurité, la disponibilité, la gouvernance des données, la qualité des résultats et les exigences d’intégration avant d’arrêter leur choix sur un modèle.
Google continuera d’ajouter des noms à son catalogue d’IA. Le moyen le plus simple de s’y retrouver est de se concentrer sur la tâche : Gemini est la famille généraliste, tandis que des modèles comme Veo, Imagen, Nano Banana, Lyria et Chirp se spécialisent dans certains types de médias et d’informations.
Note de la rédaction : cet article a été publié à l’origine dans notre publication sœur, TechRepublic.

