Le commerce électronique la plateforme Shopify a réussi à tirer parti du machine learning grâce à une stratégie méthodique en cinq étapes. Nous examinerons ci-dessous chacune de ces étapes et détaillerons la manière dont elles ont aidé l’entreprise à prospérer.
La croissance de Shopify est sans égale dans le secteur du commerce électronique. Collectivement, les marchands de la plateforme forment la 7e plus grande entreprise au monde en termes de chiffre d’affaires. Ce qui les place devant des conglomérats comme Apple et Volkswagen.
L’entreprise a été à l’avant-garde de l’adoption du ML pour la détection d’anomalies et les prévisions. C’est particulièrement impressionnant quand on sait que jusqu’à 85 % des projets de machine learning finissent par ne pas tenir leurs promesses et atteindre leurs objectifs initiaux.
Lors du séminaire « Data for the AI Community » de Cognilytica, la responsable de la data science chez Shopify, la Dre Ella Hilal, a expliqué comment le géant du commerce électronique a réussi à changer d’échelle grâce au machine learning (ML). Examinons cela de plus près.
Étape 1 : cerner clairement vos besoins en matière de prévisions
La première étape fondamentale pour tirer parti du ML est assez simple : acquérir une compréhension globale de vos besoins en matière de prévisions.
La Dre Hilal suggère quelques questions que les dirigeants d’entreprise peuvent se poser pour comprendre leurs besoins en matière de prévisions :
- Quelles décisions ces informations permettront-elles d’éclairer ?
- Quand prenez-vous ces décisions ?
- Jusqu’à quelle échéance souhaitez-vous établir des prévisions ?
- À quelle fréquence prenez-vous ces décisions ?
Gardez à l’esprit que cette approche holistique de la création d’un modèle de machine learning sera appliquée à chaque étape du processus.
À lire aussi : Principaux outils d’analyse de données
Étape 2 : comprendre vos données
La Dre Hilal a formulé la question clairement : « Quelles sources de données sont disponibles et quelles sont leurs propriétés ? »
Comprendre les propriétés de vos ensembles de données est une étape clé pour établir des prévisions. Posez-vous des questions fondamentales, par exemple pour déterminer si les données sont univariées ou multivariées. Il est également important de détecter et d’éliminer les comportements non stationnaires dans vos données chronologiques.
« Personne n’a jamais regretté de consacrer les premiers cycles de son travail à un grand modèle qui éclaire des décisions importantes, en examinant attentivement les données dont il dispose. »
Autrement dit, il est dans votre intérêt de rester curieux. Il est tout aussi important de voir quelles sources de données ne sont pas disponibles que celles qui le sont.
Comprendre vos données exige une vue d’ensemble non seulement de vos opérations, mais aussi du marché sur lequel vous évoluez. C’est grâce à ces connaissances fondamentales que les data scientists peuvent distinguer les anomalies et leurs causes précises.
Étape 3 : choisir la bonne méthode de prévision
C’est ici que commencent les étapes concrètes de l’établissement des prévisions. La Dre Hilal a proposé plusieurs caractéristiques clés que les modèles de prévision doivent posséder :
- Être faciles à interpréter.
- Pouvoir être facilement ajustés.
- Être relativement rapides.
- Fournir des prévisions automatisées.
- Gérer plusieurs types de saisonnalité et les événements récurrents.
- Gérer les observations manquantes ou les valeurs aberrantes importantes.
- Gérer les évolutions des tendances historiques.
Shopify a utilisé Facebook Prophet, un modèle de régression additive open source. L’entreprise a spécifiquement choisi ce modèle pour sa capacité à monter en charge et à générer rapidement des prévisions sur des millions de points de données.
Une autre décision clé à prendre lors de la sélection du bon modèle de prévision consiste à déterminer s’il faut adopter une approche descendante ou ascendante. Les approches descendantes examinent d’abord les indicateurs globaux et analysent les facteurs qui les déterminent, tandis que les approches ascendantes analysent et suivent d’abord ces facteurs. Parmi les autres questions à prendre en compte lors de la sélection du modèle approprié figurent les suivantes :
- Un modèle de ML unique ou une approche ensembliste ?
- À quelle fréquence prévoyez-vous de réentraîner votre modèle ?
- Avez-vous consacré suffisamment de temps à l’ajustement ? Avez-vous effectué un surapprentissage ?
À lire aussi : Meilleurs outils de business intelligence
Étape 4 : gérer le biais lié aux anomalies
« Les anomalies ne sont pas toutes mauvaises », a déclaré la Dre Hilal. En fait, si elle est expliquée efficacement et se reproduit éventuellement, les data scientists peuvent vouloir amplifier l’anomalie pour en tirer des enseignements.
Une grande partie de la gestion du biais lié aux anomalies consiste à étudier vos données au fil du temps et à analyser les périodes qui sont révélatrices des comportements futurs. Shopify disposait d’une quantité massive de données parmi lesquelles choisir, avec des cycles annuels très nets. Toutefois, l’équipe a décidé que les trois derniers mois étaient les plus révélateurs de ses performances à venir.
La Dre Hilal mentionne également que 2020 a clairement été une année atypique. Cependant, les entreprises et les data scientists doivent considérer que des anomalies et des tendances singulières existeront toujours. C’est pourquoi Shopify a également pris en compte les tendances propres à 2021.
Étape 5 : automatiser le modèle
Enfin, comme tout autre modèle de ML en production, les prévisions sont réellement efficaces lorsqu’elles sont automatisées.
Cette automatisation doit couvrir quelques points :
- Comment vos données d’entraînement sont-elles stockées ? Brutes ou transformées ?
- Comment récupérerez-vous les données nécessaires à l’entraînement ?
- Comment récupérerez-vous les données nécessaires aux prédictions ?
- Comment recueillons-nous les retours d’un modèle en production ? Des alertes systématiques sont-elles prévues ?
- Comment suivez-vous la dérive ?
N’oubliez pas que votre objectif final est que votre modèle puisse évoluer à grande échelle et fonctionner avec peu d’intervention : l’automatisation est précieuse pour assurer un fonctionnement autonome.
À lire aussi : Principales techniques d’exploration de données
Conclusion : comprendre vos décisions
Il est clair que le processus permettant de tirer parti du ML pour les prévisions et la détection d’anomalies à grande échelle commence par une compréhension globale de vos opérations, de vos besoins et de votre secteur.
À chaque étape, la Dre Hilal a souligné l’importance de prendre du recul et de comprendre le « quoi », le « comment » et le « quand » qui sous-tendent chaque décision.


