Microsoft a présenté MAI-Image-2, son dernier modèle texte-image développé en interne, conçu pour générer des visuels plus réalistes et plus exploitables dans le cadre de travaux créatifs. Cette sortie marque la deuxième étape majeure de l’entreprise dans la conception de sa propre technologie de génération d’images, après MAI-Image-1.
Microsoft présente MAI-Image-2 comme un outil conçu pour les workflows créatifs réels, plutôt que pour de simples expérimentations visuelles. Selon l’entreprise, le modèle met fortement l’accent sur le photoréalisme et l’utilisabilité.
« MAI-Image-2 est conçu pour les créatifs qui veulent des images donnant l’impression d’exister dans le monde réel, avec une lumière naturelle, des carnations fidèles et des environnements qui semblent habités », a écrit Microsoft AI dans un article de blog. L’entreprise ajoute que cette approche vise à réduire le temps consacré aux retouches, afin de permettre aux créateurs de « passer moins de temps à corriger en postproduction et plus de temps à créer ».
L’IA s’attaque à un problème récurrent : le texte dans les images
L’une des améliorations majeures de MAI-Image-2 réside dans sa capacité à générer du texte lisible et cohérent dans les images, un point faible bien connu de nombreux modèles d’IA.
Microsoft affirme que le modèle peut produire de manière fiable des visuels comportant des éléments textuels comme des affiches, des infographies, des diapositives et des schémas, avec « peu de pertes entre les instructions et la création ». Cette amélioration ouvre la voie à davantage de cas d’usage pratiques, notamment pour les designers et les spécialistes du marketing qui s’appuient sur des visuels riches en texte.
Contrairement aux modèles précédents, fortement axés sur les benchmarks techniques, MAI-Image-2 a été développé à partir des retours de photographes, de designers et de conteurs visuels.
Microsoft affirme que ces contributeurs ont aidé à repérer les principales lacunes des outils existants, notamment en matière de réalisme, de précision du texte et de capacité à créer des scènes complexes ou cinématographiques. Le modèle est également conçu pour gérer des productions plus imaginatives, notamment des concepts surréalistes et des compositions très détaillées.
MAI-Image-2 grimpe dans le classement, mais n’est pas encore en tête
MAI-Image-2 a rapidement grimpé dans le classement d’Arena.ai. Microsoft affirme que le modèle a propulsé sa famille MAI dans le top 3 mondial des laboratoires texte-image.
Toutefois, les classements montrent qu’il reste derrière des concurrents comme les modèles Gemini de Google et les systèmes GPT-Image d’OpenAI. Malgré tout, la progression est notable : MAI-Image-1 avait fait ses débuts à un niveau bien inférieur, ce qui constitue une avancée claire pour les efforts de Microsoft en matière d’IA développée en interne.
« Notre équipe a travaillé extrêmement dur pour cette sortie, et nous faisons désormais partie des meilleurs modèles disponibles », a déclaré Mustafa Suleyman, PDG de Microsoft AI, dans une publication sur X.
Un déploiement dans tout l’écosystème Microsoft
MAI-Image-2 est déjà en cours d’intégration dans la gamme de produits Microsoft. Les utilisateurs peuvent le tester dès aujourd’hui dans le MAI Playground tandis que son déploiement a commencé dans Copilot et Bing Image Creator.
L’accès pour les entreprises est également en cours de mise en place, certains clients pouvant utiliser le modèle via une API. Une disponibilité plus large pour les développeurs est attendue prochainement via Foundry.
Cette sortie intervient alors que Microsoft redouble d’efforts pour développer ses propres modèles d’IA en interne, plutôt que de s’appuyer uniquement sur son partenariat étroit avec OpenAI, qui alimentait auparavant une grande partie de Bing et de la génération d’images de Copilot. Elle fait également suite à un changement de direction. Suleyman a rejoint en novembre 2025 l’équipe AI Superintelligence pour la diriger à plein temps, et il s’agit du premier modèle rendu public depuis ce changement.
« Je suis vraiment fier de nos progrès sur les modèles et les produits — restez à l’écoute pour découvrir de nouvelles sorties et rejoignez-nous dans notre mission de Superintelligence », a ajouté Suleyman dans sa publication sur X.
À lire aussi : Les outils d’images IA s’améliorent rapidement, mais le meilleur choix dépend toujours de vos besoins : photoréalisme, rapidité, contrôles d’édition ou rendu du texte plus propre.


