OpenAI a publié une version préliminaire de recherche de GPT-5.3-Codex-Spark, une version légère de son dernier système Codex conçue spécifiquement pour le codage en temps réel.
Le modèle est conçu pour fournir des réponses rapides à des tâches telles que la modification de fonctions, l’affinement de la logique ou l’ajustement d’interfaces au sein d’outils de développement. Selon OpenAI, le modèle est optimisé pour donner une impression de réponse « quasi instantanée » et peut produire plus de 1 000 jetons par seconde lorsqu’il s’exécute sur du matériel à latence ultrafaible.
Au lancement, Codex-Spark est limité au texte, dispose d’une fenêtre de contexte de 128 k et est accessible aux utilisateurs de ChatGPT Pro via l’application Codex, l’interface en ligne de commande et l’extension VS Code. Pendant la phase de préversion, son utilisation est soumise à des limites de débit distinctes et peut être mise en file d’attente lors des périodes de forte demande.
Propulsé par le matériel de Cerebras
Le nouveau modèle marque le premier produit majeur issu du partenariat d’infrastructure avec la puce d’IA de la société Cerebras. Codex-Spark fonctionne sur le Wafer Scale Engine 3 (WSE-3), un processeur spécialisé conçu pour l’inférence à haute vitesse. L’objectif est de créer ce que l’entreprise appelle un niveau de service privilégiant la latence, qui complète l’infrastructure GPU traditionnelle.
« Ce qui nous enthousiasme le plus avec GPT-5.3-Codex-Spark, c’est de collaborer avec OpenAI et la communauté des développeurs pour découvrir ce que permet l’inférence rapide : de nouveaux modes d’interaction, de nouveaux cas d’usage et une expérience du modèle fondamentalement différente. Cette préversion n’est que le début », a déclaré Sean Lie, directeur technique et cofondateur de Cerebras.
OpenAI a souligné que le modèle lui-même ne représente qu’une partie de l’histoire. L’entreprise affirme avoir apporté des changements plus larges à l’ensemble de sa pile d’inférence afin de réduire les délais.
Selon OpenAI, l’entreprise a introduit une connexion WebSocket persistante et optimisé son API Responses. Elle affirme que ces changements ont réduit de 80 % la surcharge liée aux allers-retours entre le client et le serveur, de 30 % la surcharge par jeton et de 50 % le délai avant le premier jeton.
Le canal WebSocket est activé par défaut pour Codex-Spark et devrait devenir la norme pour les autres modèles.
Les compromis en matière de performances
Comme pour la plupart des choses dans la tech, il y a un compromis à faire. Parce que Spark est une « version plus petite » du modèle phare, il n’est pas tout à fait aussi performant. Sur des tests de référence comme SWE-Bench Pro, il obtient de bons résultats, mais reste finalement moins performant que la version complète de GPT-5.3-Codex.
Plus important encore, il ne dispose pas du même niveau de sécurité avancé que son grand frère. OpenAI a déclaré que le modèle « n’a aucune chance plausible d’atteindre le seuil de haute capacité de notre Preparedness Framework en matière de cybersécurité ou de biologie ».
Le lancement intervient alors qu’OpenAI poursuit sa stratégie plus large de diversification de ses capacités de calcul. eWeek avait précédemment rapporté qu’OpenAI avait accepté d’acheter des capacités de calcul à Cerebras dans le cadre d’un accord évalué à plus de 10 milliards de dollars US, bien que l’annonce officielle du partenariat par OpenAI n’ait pas communiqué de détails financiers.
Cerebras a récemment annoncé avoir levé 1 milliard de dollars US de nouveaux financements, pour une valorisation de 23 milliards de dollars US, ce qui souligne son rôle croissant dans l’infrastructure de l’IA.
Pour en savoir plus sur les difficultés financières de l’entreprise, consultez notre analyse de l’enjeu croissant de rentabilité d’OpenAI et de ce qu’il implique pour la course à l’IA.

