OpenAI a annoncé aujourd’hui la sortie de ChatGPT Images 2.0, une refonte majeure qui va au-delà du modèle d’images générées par IA à usage unique.
Cette mise à jour, propulsée par le nouveau modèle gpt-image-2, introduit un mode Thinking qui permet à l’IA de faire des recherches sur le Web, de planifier des mises en page et de générer des séries cohérentes d’images plutôt que de simples carrés isolés.
La philosophie fondamentale de cette version repose sur un changement dans notre façon d’utiliser les visuels générés par IA. OpenAI ne présente plus cet outil comme un jouet servant à créer de jolies images, mais comme un outil destiné au travail réel. « Les images sont un langage, pas une décoration. Une bonne image fait ce qu’une bonne phrase fait — elle sélectionne, agence et révèle », a écrit l’entreprise. « Elle peut expliquer un mécanisme, installer une ambiance, mettre une idée à l’épreuve ou défendre un point de vue. »
En intégrant les capacités de raisonnement de sa série O, le modèle ne se contente plus de dessiner : il planifie. Lorsque vous utilisez le nouveau mode Thinking, l’IA agit davantage comme un partenaire de conception. Elle peut consulter le Web pour obtenir des informations en temps réel, analyser les documents importés afin de créer des infographies et vérifier son propre travail avant de vous le présenter.
Si vous avez déjà essayé de faire générer un menu ou une pancarte par une IA, vous connaissez les difficultés posées par le charabia produit par l’IA. Images 2.0 affirme avoir résolu ce problème. Le modèle gère désormais les textes denses, les petites icônes et les interfaces utilisateur (UI) complexes avec une précision de niveau professionnel.
Le modèle s’est également ouvert au monde entier. Alors que les modèles précédents peinaient avec les écritures non latines, cette version est polyglotte et affiche des progrès significatifs en japonais, en coréen, en chinois, en hindi et en bengali. Plutôt que de simplement traduire les mots, le système est conçu pour intégrer naturellement la langue à la mise en page visuelle, une amélioration qui pourrait le rendre plus utile aux publics du monde entier et à la création de contenus localisés.
Des formats flexibles et des rendus de meilleure qualité
ChatGPT Images 2.0 prend en charge une plus grande variété de rapports d’aspect, permettant aux utilisateurs de générer des visuels allant de 3:1 (large) à 1:3 (vertical). Cette flexibilité facilite la création de ressources pour tout type de support, des présentations aux réseaux sociaux.
Le modèle peut également produire des images avec une résolution allant jusqu’à 2K, avec des résolutions encore plus élevées en cours de test via l’API.
Au lieu d’une création d’images à partir d’une seule instruction , l’interaction avec le système devient plus conversationnelle. Les utilisateurs peuvent affiner les résultats étape par étape, ajuster des éléments, modifier les mises en page ou faire évoluer leurs idées sans recommencer depuis le début. Le système conserve le contexte, ce qui permet un processus de conception plus fluide.
Les développeurs et les cas d’usage professionnels
OpenAI cherche également à étendre cette technologie au-delà d’un usage récréatif. Le nouveau modèle gpt-image-2 est disponible via son API, ce qui permet aux développeurs d’intégrer la génération avancée d’images à leurs produits.
L’entreprise estime que cela pourrait servir à des applications concrètes comme la conception marketing, les contenus pédagogiques et les outils créatifs. L’intégration à Codex permet également aux utilisateurs de générer des visuels et de les faire évoluer dans le cadre d’un flux de travail plus large, notamment pour le développement d’applications et la conception de produits.
Disponibilité et accès
ChatGPT Images 2.0 Instant est disponible dès aujourd’hui pour tous les utilisateurs de ChatGPT et de Codex, y compris ceux de l’offre gratuite. Le mode Thinking, avec recherche sur le Web, génération de plusieurs images et capacités de raisonnement, est réservé aux abonnés ChatGPT Plus, Pro et Business.
Les développeurs peuvent accéder au modèle via l’API sous l’identifiant gpt-image-2, au tarif de 8,00 dollars US par entrée, 2,00 dollars US pour les entrées mises en cache et 30,00 dollars US par sortie, le prix variant selon la qualité et la résolution sélectionnées.
Certaines limites subsistent. OpenAI indique que le modèle peut encore rencontrer des difficultés avec les tâches nécessitant une représentation précise du monde physique, comme les guides d’origami, les configurations de Rubik’s Cube et les surfaces inclinées, masquées ou inversées.
Les textures très denses ou répétitives, comme les grains de sable, peuvent également mettre le modèle à l’épreuve. De plus, les légendes des diagrammes, en particulier celles qui reposent sur des flèches précises et des références aux différentes parties, peuvent encore nécessiter une vérification humaine.
À lire également : Notre aide-mémoire ChatGPT explique comment la génération et l’édition d’images, le raisonnement et les outils Web s’intègrent désormais à la gamme élargie de produits d’OpenAI.

