Les utilisateurs d’IA ont trouvé moins de solutions de repli jeudi matin.
ChatGPT, Claude et Grok ont subi des pannes simultanées le 3 septembre, tandis que des utilisateurs de Gemini signalaient eux aussi des problèmes. Pour les entreprises qui s’appuient de plus en plus sur plusieurs fournisseurs d’IA comme stratégie de secours, cette perturbation a mis en lumière une possibilité inconfortable : changer de modèle ne sert pas à grand-chose lorsque plusieurs services tombent en panne en même temps.
Les incidents confirmés touchant ChatGPT, Claude et Grok se sont chevauchés pendant plus d’une heure, transformant ce qui aurait pu rester des pannes isolées chez des fournisseurs en un test plus large de la résilience de l’IA.
Les pannes se propagent aux chatbots et aux outils de développement
Anthropic et SpaceXAI ont commencé à signaler des problèmes avec Claude et Grok à quelques minutes d’intervalle, peu après 9 h 25, heure de l’Est, selon leurs rapports d’incidents. OpenAI a signalé la sienne à 10 h 43. Les trois fournisseurs avaient rétabli le service à 13 h 07.
Les problèmes ont atteint les outils professionnels ainsi que les chatbots grand public. Anthropic a cité l’API de Claude et Claude Code parmi les produits touchés. Cowork a également rencontré des erreurs, et la panne d’OpenAI a affecté Codex.
Le rapport d’incident de SpaceXAI indique une panne de trois heures et 37 minutes pour Grok, l’incident confirmé le plus long du groupe. Des utilisateurs de Gemini ont également signalé des réponses qui n’aboutissaient pas et des performances ralenties, a rapporté Gulf News, même si Google n’avait pas confirmé de panne généralisée touchant les utilisateurs grand public à ce moment-là.
Les explications des fournisseurs ne permettent pas d’établir une cause commune
Les réponses officielles des grandes entreprises d’IA différaient dans le niveau de détail. Une porte-parole d’OpenAI a déclaré à USA TODAY qu’« une erreur de routage » avait rendu ChatGPT et Codex indisponibles pour certains utilisateurs. Anthropic a également attribué la panne de Claude à des problèmes d’infrastructure, selon l’article.
SpaceXAI a fourni l’explication la plus précise. « Nous sommes désolés pour les problèmes que vous avez pu rencontrer avec Grok après une panne survenue ce matin dans notre centre de calcul de Memphis », a écrit sur X. SpaceXAI a également présenté ses excuses à ses « partenaires de calcul touchés ».
Aucun fournisseur n’a établi de lien entre les incidents, et leur simple concomitance ne suffit pas à démontrer l’existence d’une cause commune.
Ce qu’a constaté eWeek : les plans de basculement de l’IA présentent un point faible
Après avoir comparé les chronologies d’incidents publiées par les fournisseurs, eWeek a constaté que ChatGPT, Claude et Grok avaient été simultanément touchés pendant 93 minutes. Gemini a été exclu du calcul, car les rapports disponibles ne fournissaient pas de données suffisamment cohérentes sur les heures de début et de rétablissement.
Ce chevauchement est important, car changer de fournisseur est l’un des moyens les plus simples dont disposent les organisations pour intégrer de la résilience dans leurs flux de travail liés à l’IA. Mais les applications liées à l’API d’un seul fournisseur ont besoin d’une logique de basculement préconfigurée pour changer automatiquement de service, tandis que les outils de développement et l’ automatisation intelligente peuvent rester indisponibles jusqu’à ce que les ingénieurs les redirigent ou que le service d’origine soit rétabli.
Les équipes qui élaborent des plans de résilience de l’IA peuvent tester ces plans avant une panne en retirant temporairement leur modèle principal d’un flux de travail. Les employés doivent pouvoir accomplir la même tâche avec le service de secours sans demander de nouveaux accès, recréer les invites ou le contexte, ni attendre que les ingénieurs reconfigurent les intégrations.
Un transfert qui échoue peut révéler des lacunes en matière d’authentification, de compatibilité des API, de transfert du contexte, d’autorisations ou de formation des employés avant que ces problèmes ne surviennent lors d’une véritable panne.
Une seule panne d’IA peut souvent être contournée. Plusieurs pannes simultanées révèlent si un véritable plan de secours existe dans le flux de travail ou s’il figure seulement sur une liste de fournisseurs.
À lire aussi : découvrez comment Astra et SafeMind adoptent des approches différentes en matière de cyberdéfense des entreprises et où ces stratégies peuvent se recouper.


