OpenAI a lancé GPT-5.1-Codex-Max, qu’il présente comme une avancée majeure pour les systèmes de codage agentiques conçus pour fonctionner sur de longues périodes.
Le modèle est désormais disponible pour tous les utilisateurs de Codex sur la CLI, l’extension pour IDE, l’environnement cloud et les outils de revue de code, l’accès à l’API devant suivre prochainement.
Selon l'annonce, le nouveau système est considérablement plus rapide, plus intelligent et plus efficace que ses prédécesseurs, marquant un tournant vers une IA capable de maintenir des flux de travail d’ingénierie logicielle étendus, durant plusieurs heures, avec bien moins d’interruptions et d’échecs.
Les modèles de codage à horizon long
OpenAI présente GPT-5.1-Codex-Max comme le premier modèle de codage de l’entreprise explicitement entraîné à fonctionner sur plusieurs fenêtres de contexte grâce à une technique appelée compactage. Le modèle peut maintenir un raisonnement cohérent sur des millions de tokens, ce qui permet d’effectuer des tâches qui dépassaient traditionnellement les limites de mémoire des systèmes d’IA.
Cette architecture permet au modèle de gérer des refactorisations à l’échelle d’un projet, des sessions de débogage approfondies, des boucles continues d’utilisation d’outils et un travail autonome prolongé. Selon OpenAI, GPT-5.1-Codex-Max peut fonctionner pendant des heures sans intervention humaine, et des tests internes ont démontré des sessions ininterrompues de plus de 24 heures.
La capacité à gérer des flux de travail aussi prolongés est considérée par les chercheurs comme un prélude à des agents d’IA plus généraux, capables de prendre en charge des projets plus vastes et plus complexes. OpenAI souligne que GPT-5.1-Codex-Max constitue un progrès concret dans cette direction.
Performances en ingénierie logicielle
OpenAI rapporte que GPT-5.1-Codex-Max surpasse les précédents modèles Codex sur plusieurs benchmarks de codage simulant des tâches d’ingénierie réelles. Ceux-ci comprennent la rédaction de pull requests, la revue de code, le développement front-end et le débogage sous forme de questions-réponses.
Le modèle est également la première variante de Codex d’OpenAI entraînée pour fonctionner de manière fiable dans des environnements Windows — un changement important, car de nombreuses équipes d’ingénierie en entreprise s’appuient sur des infrastructures basées sur Windows.
OpenAI indique que GPT-5.1-Codex-Max a été entraîné sur des tâches destinées non seulement à améliorer son raisonnement, mais aussi à en faire un partenaire plus collaboratif au sein de la CLI Codex, avec une meilleure réactivité interactive et un comportement plus robuste lors des appels d’outils.
Efficacité en tokens
L’une des principales améliorations mises en avant concerne l’efficacité en tokens. OpenAI indique que GPT-5.1-Codex-Max utilise nettement moins de tokens de réflexion pour obtenir de meilleurs résultats avec les mêmes paramètres d’effort de raisonnement. Par exemple, sur SWE-bench Verified, le modèle atteindrait une meilleure précision que GPT-5.1-Codex tout en utilisant 30 % de tokens de réflexion en moins.
L’entreprise introduit un mode de raisonnement Extra High, nommé « xhigh », destiné aux tâches pour lesquelles la latence n’est pas un problème et où un raisonnement plus approfondi peut fournir des résultats plus fiables. Toutefois, un raisonnement d’effort moyen reste recommandé pour l’utilisation quotidienne.
En pratique, OpenAI affirme que cette efficacité se traduit par de véritables économies. Lors de tests internes, GPT-5.1-Codex-Max a produit des interfaces front-end complexes offrant des fonctionnalités et une finition visuelle similaires, tout en nécessitant nettement moins de ressources.
Maintenir le travail dans la durée
Le mécanisme de compactage est au cœur de ce qui différencie GPT-5.1-Codex-Max des systèmes précédents. Lorsque les sessions approchent de la limite de la fenêtre de contexte du modèle, celui-ci compresse automatiquement l’historique de la session — en supprimant les informations de faible importance tout en préservant le contexte essentiel.
Selon OpenAI, ce processus libère de l’espace pour poursuivre la tâche sans perdre les progrès accomplis, permettant ainsi à un même projet de s’étendre sur plusieurs fenêtres de contexte indépendantes, sans effondrement du contexte ni oubli catastrophique.
L’entreprise a présenté une refactorisation autonome de 24 heures du dépôt open source de la CLI Codex. Le modèle a testé son propre travail à plusieurs reprises, s’est adapté aux tests en échec et a itéré jusqu’à ce que les résultats répondent aux critères. De telles démonstrations montrent comment les modèles de codage agentiques pourraient de plus en plus accomplir de bout en bout des tâches d’ingénierie à forte valeur ajoutée.
Capacités et risques en cybersécurité
GPT-5.1-Codex-Max affiche également un raisonnement à horizon long renforcé dans les domaines de la cybersécurité. Le modèle n’atteint pas encore le niveau de capacité « High » selon le Preparedness Framework d’OpenAI, mais l’entreprise le décrit comme le système de cybersécurité le plus avancé qu’elle ait déployé à ce jour.
Cette capacité accrue comporte à la fois des opportunités et des risques.
D’une part, les défenseurs pourraient bénéficier de l’analyse automatisée des vulnérabilités, de la synthèse de correctifs et de la surveillance continue. D’autre part, ces mêmes capacités pourraient être détournées par des acteurs malveillants pour identifier des faiblesses ou automatiser des opérations offensives.
Consciente de ce défi lié au double usage, OpenAI affirme avoir mis en place une surveillance renforcée spécifique à la cybersécurité. L’entreprise indique avoir déjà déjoué des tentatives de détournement et étendre ses protections afin de se préparer à des modèles approchant ou dépassant les classifications de capacité « High ».
Codex continue de fonctionner par défaut dans un environnement sandbox restreint. OpenAI conseille vivement aux développeurs d’éviter d’activer l’accès réseau sauf en cas d’absolue nécessité, avertissant que l’exposition à du contenu non fiable peut introduire des risques tels que les attaques par injection de prompt.
La supervision humaine à l’ère des agents autonomes
À mesure que GPT-5.1-Codex-Max devient capable d’accomplir de manière autonome des tâches plus longues et plus complexes, OpenAI insiste sur l’importance de la supervision humaine. Les développeurs sont encouragés à examiner les journaux, les appels d’outils et les résultats des tests avant de déployer du code généré par un modèle.
OpenAI affirme que Codex doit être considéré comme « un réviseur supplémentaire et non comme un remplaçant des revues humaines », même si ses vérifications automatisées réduisent considérablement le risque de voir des bugs atteindre la production.
Cela illustre l’émergence d’un nouveau paradigme en ingénierie logicielle, dans lequel les agents d’IA pourraient prendre en charge une grande partie de l’implémentation et des itérations, tandis que les humains joueraient le rôle de superviseurs, d’auditeurs et d’approbateurs finaux.
Déploiement dans les différentes offres et produits
GPT-5.1-Codex-Max est désormais disponible dans tout l’écosystème Codex pour les clients ChatGPT Plus, Pro, Business, Edu et Enterprise. Il devient également le modèle Codex par défaut à compter d’aujourd’hui, en remplacement de GPT-5.1-Codex sur toutes les principales interfaces destinées aux utilisateurs.
L’entreprise précise que GPT-5.1 reste un modèle généraliste, tandis que GPT-5.1-Codex-Max est spécifiquement optimisé pour les tâches de codage agentiques et s’utilise de préférence dans les environnements Codex ou avec des outils qui s’en rapprochent étroitement.
L’accès à l’API pour les développeurs utilisant la CLI Codex via une clé d’API devrait être lancé prochainement.
Des implications plus larges
OpenAI met en avant l’impact interne de l’adoption de Codex : 95 % des ingénieurs de l’entreprise utilisent Codex chaque semaine, et les équipes soumettraient environ 70 % de pull requests supplémentaires depuis l’intégration de Codex dans leur flux de travail.
Cela suggère une évolution plus large de la manière dont les équipes de développement pourraient fonctionner. À mesure que les modèles d’IA deviennent capables de maintenir un raisonnement plus approfondi, de coordonner des tâches en plusieurs étapes et de gérer des bases de code sur de longues périodes, la relation entre les développeurs et leurs outils pourrait évoluer vers des flux de travail humains-IA plus collaboratifs.
Pour l’avenir, OpenAI présente GPT-5.1-Codex-Max comme une nouvelle étape vers des systèmes d’IA agentiques généralistes capables de gérer de manière autonome des projets d’ingénierie complets.
Les systèmes d’IA aiment affirmer qu’ils sont neutres. Nous avons testé cinq grands modèles de génération de texte — ChatGPT, Claude, Gemini, Microsoft Copilot et Perplexity. Découvrez les résultats ici.

