Google a déployé Gemini 2.5 Flash, son modèle avancé d’édition d’images par IA, le rendant largement accessible. Son application native de génération d’images, Nano Banana, propose désormais 10 nouveaux formats d’image ainsi qu’une option de sortie composée uniquement d’images.
Les formats d’image permettent de créer des images générées par IA avec la forme idéale pour différents usages, comme des publications verticales sur les réseaux sociaux ou de vastes paysages. Gemini 2.5 Flash Image prend désormais en charge les formats paysage (21:9, 16:9, 4:3, 3:2), carré (1:1), portrait (9:16, 3:4, 2:3) et « flexibles » (5:4, 4:5).
L’autre nouveauté est la possibilité de spécifier une sortie composée uniquement d’images. Par défaut, le modèle renvoie des réponses textuelles et visuelles, avec une explication textuelle accompagnant l’image générée, mais ce comportement peut être remplacé en substituant response_modalities=[‘Text’, ‘Image’] par response_modalities=[‘Image’].
Découvrez les fonctionnalités de Gemini 2.5 Flash dans des applications prêtes à l’emploi, ou créez la vôtre
Gemini 2.5 Flash a d’abord été lancé en version préliminaire via l’API Gemini et Google AI Studio fin août. Les développeurs peuvent l’utiliser pour créer leurs propres applications d’édition d’images par IA ou exploiter certaines des applications de démonstration créées par Google à l’aide du vibe coding.
Ce puissant modèle peut créer un personnage et le placer dans différentes scènes, comme un désert ou un environnement sous-marin, tout en conservant une apparence cohérente. Google le montre dans son application Past Forward, qui peut prendre une photo de l’utilisateur puis le placer à différentes époques, ainsi que dans Fit Check, qui peut modifier les vêtements ou la pose d’une personne.
Gemini 2.5 Flash peut interpréter des commandes en langage naturel pour retoucher des photos. Dans l’application Pixshop, les utilisateurs peuvent lui demander explicitement de supprimer des personnes, de flouter les arrière-plans ou de coloriser des photos, sans aucune connaissance technique des méthodes de retouche. De son côté, Gemini Co-Drawing leur permet de dessiner, puis de demander à l’IA de perfectionner leur création à l’aide d’une invite textuelle.
Bien qu’il s’agisse principalement d’un modèle d’images, Gemini 2.5 Flash dispose également de connaissances du monde réel qui peuvent être utilisées dans ses applications. Gemini Co-Drawing peut interpréter ce que vous dessinez et fournir des informations supplémentaires, par exemple en ajoutant des étiquettes, en mesurant des angles ou en insérant des objets pertinents.
Les utilisateurs peuvent également fusionner plusieurs images avec le nouveau modèle. Dans l’application Home Canvas, par exemple, ils peuvent faire glisser une image d’objet dans une scène, puis le système génère un composite photoréaliste qui intègre naturellement l’objet à son environnement.
Les développeurs peuvent l’essayer gratuitement dans Google AI Studio
Toutes ces applications déjà disponibles peuvent être testées dans Google AI Studio, et la section Build permet aux utilisateurs de créer leurs propres applications basées sur Gemini 2.5 Flash à l’aide d’une simple invite textuelle. L’API Gemini permet d’intégrer le modèle à du code existant, ce qui donne aux entreprises la possibilité d’y accéder via la plateforme Vertex AI de Google Cloud.
Gemini 2.5 Flash Image est accessible gratuitement via Google AI Studio ; toutefois, pour une utilisation en production ou des besoins importants en volume, les développeurs doivent passer à une tarification à l’usage. La génération native d’images coûte 0,039 dollar US par image, tandis que les sorties textuelles et multimodales sont facturées 30 dollars US par million de jetons.
Ailleurs, OpenRouter a ajouté Gemini 2.5 Flash comme son tout premier modèle d’image, fal.ai l’intègre à sa communauté de développeurs, et Adobe l’a intégré à Firefly. Cela témoigne d’une évolution stratégique plus large chez les entreprises spécialisées dans l’IA : elles délaissent la compétition fondée sur les seules performances brutes au profit d’écosystèmes flexibles où les utilisateurs peuvent choisir l’outil le mieux adapté à leur tâche.
Gemini 2.5 Flash n’est peut-être pas le plus grand générateur de médias par IA lancé cette semaine. Sora 2 d’OpenAI est arrivé, permettant aux utilisateurs de créer des vidéos mettant en scène des personnages protégés par le droit d’auteur.


