Dire que le cloud est essentiel à notre façon de travailler, de vivre et de nous divertir serait un euphémisme majeur : il constitue désormais un élément critique de l’infrastructure technologique. Pourtant, les causes sous-jacentes de ces pannes restent souvent mystérieuses. C’est pourquoi un récent webcast de ThousandEyes a retenu mon attention : il examinait en détail les principales pannes du cloud survenues en 2023.
Animé par Brian Tobia, Lead Technical Marketing Engineer chez ThousandEyes, ce webcast proposait notamment une analyse de l’anatomie d’une panne. « Il est important de comprendre les différents types de pannes que nous observons, a-t-il déclaré. Les comprendre peut vous aider à déterminer comment atténuer une partie de leur impact. » Selon lui, les pannes peuvent varier par leur rayon d’impact, selon qu’elles sont planifiées ou non, ainsi que par leur délai moyen de rétablissement.
Examinons les causes des principales pannes du cloud de l’année — et ce que nous pouvons tirer de ces incidents malheureux.
Les différents types de pannes du cloud
« L’architecture distribuée des applications actuelles signifie qu’un grand nombre d’éléments doivent être orchestrés pour qu’un système fonctionne réellement, a expliqué Tobia. Et beaucoup de ces éléments constituent souvent des points uniques de défaillance. Comme ils sont réutilisés dans plusieurs applications, par exemple une API ou un service commun, l’impact d’une panne peut être beaucoup plus large, même lorsqu’il ne s’agit que d’un seul service. »
Tobia a souligné que le suivi de cloud computing permet aux équipes d’identifier des tendances et d’éviter les interruptions de service pour les clients.
En examinant le rapport ThousandEyes de 2023, Tobia a expliqué qu’il existait de nombreux types de pannes. « Globalement, les pannes liées aux FAI restent les plus courantes, a-t-il déclaré. Mais nous avons constaté une hausse des pannes liées aux fournisseurs de services cloud (CSP) en 2023 par rapport aux années précédentes. »
En 2023, le nombre de pannes centrées sur les États-Unis est passé de 34 % à 37 %, et les pannes mineures sont devenues plus fréquentes. « Nous constatons que ces pannes de moindre ampleur et plus circonscrites deviennent plus courantes, a-t-il déclaré. Auparavant, il y avait traditionnellement beaucoup de pannes réseau de grande ampleur — de très grandes pannes — qui mettaient un grand nombre de services hors ligne. Mais nous en observons aussi de plus petites. »
Mais même une panne du cloud qui débute aux États-Unis en raison d’une opération de maintenance nocturne peut se propager à d’autres zones géographiques en pleine journée ouvrée.
Les pannes d’applications en hausse
Tobia a indiqué que les pannes d’applications, qui ont continué d’augmenter en 2023, pouvaient avoir un impact plus important. Une panne réseau affectera un seul fournisseur, mais ce n’est pas le cas pour les applications. « La panne d’une application se propage réellement parce que beaucoup de personnes dépendent de cette application, a-t-il expliqué. Peu importe le réseau depuis lequel vous vous connectez. »
Il a ensuite présenté quelques exemples de pannes survenues en 2023, en mettant l’accent sur le fonctionnement de ThousandEyes. « Nous sommes en mesure de collecter toutes ces données grâce à ThousandEyes, a-t-il déclaré. Pouvoir les corréler et recueillir toutes ces informations est vraiment essentiel pour obtenir une vue de bout en bout de l’endroit où une panne peut survenir. Il est également très important de corréler ces données à travers chaque couche. »
Il a ajouté que ThousandEyes pouvait montrer aux utilisateurs chaque couche d’une connexion, qu’il s’agisse du protocole de passerelle frontière (BGP), des réseaux, des applications, des erreurs HTTP ou des temps de chargement des pages.
Principales pannes du cloud en 2023
Tobia a détaillé la liste des pannes de 2023, notamment :
- Une panne de 90 minutes chez Microsoft le 25 janvier : Elle était due à des modifications du BGP qui ont provoqué des problèmes réseau. « Du point de vue du BGP, c’était le chaos total », a déclaré Tobia.
- Une panne de deux heures d’Outlook le 7 février : Elle s’est traduite par des erreurs indiquant que le service était indisponible et par des erreurs applicatives. « La dernière panne était davantage liée à des modifications sur leurs routeurs de FAI et d’autres routeurs WAN, a-t-il expliqué. Elle se situait peut-être davantage du côté applicatif. »
- Une panne de sept heures de Virgin Media le 4 avril : Cette panne est survenue à la suite du retrait d’une route BGP, qui a entraîné une perte de trafic réseau. « C’était un peu similaire à ce que nous avions observé du côté de Microsoft, lorsque ces modifications du BGP se produisaient, a-t-il déclaré. En l’absence de route vers le réseau britannique de Virgin Media, de nombreux fournisseurs Internet et de transit ont abandonné le trafic. »
- Une panne de deux heures du cloud d’AWS le 14 juin : Cette panne a provoqué de la latence, des délais d’expiration des serveurs et des erreurs HTTP. « Ils ont finalement identifié le problème comme faisant partie de leur système de gestion de la capacité situé dans US-EAST-1, a-t-il expliqué. Cela a affecté des services comme la passerelle API Lambda, ainsi que la console de gestion elle-même, Global Accelerator. »
- Une panne de deux heures du cloud de Slack le 2 août : À la suite de cette panne, les utilisateurs ne pouvaient ni envoyer ni recevoir de messages. « Les chemins réseau étaient parfaitement opérationnels, a-t-il déclaré. Nous n’avons constaté aucune perte de paquets, aucune latence ni quoi que ce soit de ce genre. Il s’agissait donc purement d’un problème applicatif ou côté client. »
- Une panne de 18 heures du cloud de Square le 8 septembre : Cette panne a entraîné des erreurs dans l’application et l’échec de transactions côté backend. « Cette panne l’a empêchée de traiter les transactions, a-t-il expliqué. Les utilisateurs finaux pouvaient donc effectivement soumettre une transaction — certains vendeurs qui l’utilisaient pour recevoir des paiements y sont parvenus, [mais certains utilisateurs] ont signalé des déconnexions ou des problèmes de fonctionnement. »
- Une panne de 36 heures de Workday/Cloudflare qui a débuté le 2 novembre : Une panne de courant totale dans un centre de données de Cloudflare a provoqué des problèmes au niveau des applications et des services. « Cloudflare était le fournisseur et Workday une application exécutée sur l’infrastructure de Cloudflare », a-t-il expliqué. Il a précisé que les ressources de reprise après sinistre avaient mis 6 heures à être opérationnelles. « Il y a donc eu une panne complète jusqu’à la remise en service de cette installation, a-t-il ajouté. Elle a pu traiter les requêtes à un débit réduit, puis le rétablissement complet n’est intervenu que plus de 36 heures plus tard. »
En conclusion : la supervision est indispensable pour prévenir les pannes du cloud
Quelle année chargée ! Les exemples de pannes du cloud présentés par Tobia étaient clairement préoccupants. Qui aurait pensé qu’une panne de courant totale était encore possible aujourd’hui, avec les centres de données sophistiqués exploités par des fournisseurs comme Cloudflare ? Ils ont pourtant dû faire face au processus laborieux de mise en service de leur dispositif de reprise après sinistre et collaborer avec un fournisseur d’électricité qui n’avance peut-être pas au rythme le plus soutenu.
La présentation de Tobia a également souligné l’importance de superviser les ressources afin de comprendre ce qui se passe lorsqu’un service tombe en panne, de manière à en tirer des enseignements et à éviter de reproduire les mêmes erreurs.
Malheureusement, pour la plupart des entreprises, disposer d’une solution de secours pour chaque service cloud utilisé par l’organisation serait financièrement difficile. Pour les accompagner, les responsables informatiques peuvent exploiter les données d’entreprises comme ThousandEyes afin d’intégrer la disponibilité aux critères d’évaluation.
Pour un guide complet du secteur du cloud computing, consultez notre dossier approfondi : Principaux fournisseurs et entreprises de services cloud


