Guide du machine learning : le parcours d’un débutant vers la maîtrise

Aug 12, 2024
19 minute read
Artificial intelligence brain with ring gears on binary code background.

Image: nicescene/Adobe Stock

eWeek Le contenu et les recommandations de produits sont indépendants de la rédaction. Nous pouvons gagner de l'argent lorsque vous cliquez sur des liens vers nos partenaires. En savoir plus

Le machine learning (ML) s’appuie sur des modèles mathématiques avancés appelés algorithmes pour améliorer les outils d’intelligence artificielle en les aidant à analyser et à comprendre les données, afin de leur permettre « d’apprendre » à partir de ces données et d’améliorer continuellement leurs performances. Le ML utilise diverses techniques pour faciliter des tâches d’intelligence artificielle telles que le traitement du langage naturel (NLP), la reconnaissance d’images et l’analyse prédictive. L’apprentissage et l’adaptation continus favorisent l’innovation et la transformation dans de nombreux secteurs.

À RETENIR


  • Le machine learning est un type d’intelligence artificielle qui analyse et traite les données pour aider les humains à prendre des décisions fondées sur les données. (Accéder à la section)

  • Le machine learning consiste à collecter, traiter, entraîner, ajuster, évaluer, visualiser et déployer des données sous forme de modèle. (Accéder à la section)

  • Les données utilisées pour le machine learning peuvent provenir de jeux de données publics ou propriétaires, de données issues du crowdsourcing, de données synthétiques ou de données provenant d’initiatives gouvernementales ouvertes. (Accéder à la section)

Qu’est-ce que le machine learning ?

Le machine learning désigne l’utilisation de modèles mathématiques avancés, ou d’algorithmes, pour traiter de grands volumes de données et en tirer des informations sans instruction ni intervention humaine directe. Sous-ensemble de l’intelligence artificielle (IA) reposant sur des réseaux neuronaux artificiels (RNA) ou des réseaux neuronaux simulés (RNS) — essentiellement des couches de nœuds qui interagissent et sont interconnectés —, il comprend également un type spécialisé de machine learning appelé deep learning (DL).

Le machine learning imite la façon dont les humains apprennent. Il repère des schémas, puis utilise les données pour prédire des comportements, des actions et des événements futurs. Il exploite de nouvelles données pour s’adapter constamment et modifier ses actions lorsque cela est nécessaire. Cette capacité à apprendre de l’expérience le distingue des outils statiques tels que l’informatique décisionnelle (BI) et l’analyse de données.

Advertisement

Les organisations de tous les secteurs se tournent vers le ML pour relever des défis commerciaux complexes. Cette technologie est particulièrement utile dans des domaines comme le marketing et les ventes, les services financiers, la santé, la distribution, l’énergie, les transports et la planification gouvernementale.

Comment fonctionnent les systèmes de machine learning ?

Le machine learning permet aux ordinateurs d’apprendre à partir des données et de prendre des décisions sans programmation explicite, grâce à plusieurs étapes clés allant de la collecte des données au déploiement du modèle.

Collecte des données

La collecte des données est une étape essentielle du développement d’un système de machine learning. Elle consiste à rassembler des données provenant de plusieurs sources pertinentes pour le problème à résoudre. Ces données peuvent provenir de diverses sources, notamment de capteurs, de bases de données, des interactions avec les utilisateurs et de l’extraction de données sur le Web. La qualité et la quantité des données collectées ont une incidence importante sur l’efficacité du modèle de machine learning : par exemple, si vous créez un modèle capable de reconnaître des photos de chats, vous aurez besoin d’une grande variété d’images de chats pour l’entraîner efficacement.

Prétraitement des données

Une fois acquises, les données doivent généralement être nettoyées et mises en forme avant d’être analysées. Cela comprend la suppression des doublons, le traitement des valeurs manquantes et la normalisation ou la mise à l’échelle des données numériques. Le prétraitement est nécessaire, car les données brutes sont rarement dans un état idéal pour l’analyse. Par exemple, si vous travaillez avec des données textuelles, vous devrez peut-être supprimer la ponctuation et convertir tout le texte en minuscules afin de garantir sa cohérence. Le prétraitement convertit les données dans un format mieux adapté à leur utilisation comme entrée d’un modèle de machine learning.

Advertisement

Modélisation des données

La modélisation des données est le processus de sélection et de construction d’un algorithme de machine learning destiné à générer des prédictions ou des décisions à partir de données. Plusieurs modèles sont disponibles, notamment les modèles de régression, les arbres de décision et les réseaux neuronaux ; le choix dépend de la nature des données et du problème à résoudre. Par exemple, un modèle de régression linéaire peut servir à estimer la valeur d’un bien immobilier en fonction de facteurs tels que son emplacement et sa superficie, tandis qu’un réseau neuronal convolutif (CNN) est mieux adapté aux tâches de classification d’images.

Entraînement des données

L’entraînement des données est le processus consistant à introduire des données prétraitées dans un modèle de machine learning afin qu’il apprenne à partir de ces données. Durant cette phase, le modèle actualise ses paramètres internes pour réduire les erreurs de prédiction. Cette technique nécessite de séparer les données en ensembles d’entraînement et de validation. L’ensemble d’entraînement sert à entraîner le modèle, tandis que l’ensemble de validation permet d’évaluer ses performances. Au fil du temps, le modèle apprend les schémas et les corrélations présents dans les données, ce qui lui permet de produire des prédictions plus précises.

Advertisement

Ajustement des hyperparamètres

L’ajustement, également appelé ajustement ou optimisation des hyperparamètres, consiste à modifier les hyperparamètres d’un modèle afin d’améliorer ses performances. Les hyperparamètres sont des paramètres qui influencent le processus d’apprentissage, comme le taux d’apprentissage, le nombre de couches d’un réseau neuronal ou la profondeur maximale d’un arbre de décision. L’ajustement précis de ces paramètres peut considérablement améliorer la précision et l’efficacité du modèle. La recherche en grille et la recherche aléatoire sont deux techniques couramment utilisées pour déterminer la combinaison optimale d’hyperparamètres.

Évaluation des performances

L’évaluation analyse l’efficacité du modèle entraîné sur des données inconnues jusque-là, appelées ensemble de test. Selon la tâche, cette étape consiste à surveiller divers indicateurs de performance, notamment l’exactitude, la précision, le rappel et le score F1. L’évaluation détermine dans quelle mesure le modèle se généralise à de nouvelles données et détecte d’éventuels problèmes, comme le surapprentissage ou le sous-apprentissage. Le surapprentissage se produit lorsque le modèle fonctionne bien sur les données d’entraînement, mais mal sur de nouvelles données, tandis que le sous-apprentissage survient lorsque le modèle est trop simpliste pour saisir les schémas sous-jacents des données.

Advertisement

Visualisation des données

La visualisation des données est le processus consistant à présenter les résultats du modèle de machine learning dans un format compréhensible. Il peut s’agir de créer des graphiques, des diagrammes et des cartes thermiques pour illustrer les données de performance, la pertinence des caractéristiques ou les prévisions. La visualisation aide à interpréter les résultats, à identifier les tendances et à communiquer les conclusions aux parties prenantes. Par exemple, une matrice de confusion peut servir à visualiser les performances d’un modèle de classification en affichant le nombre de prédictions correctes et incorrectes.

Déploiement du modèle

Le déploiement du modèle consiste à intégrer un modèle entraîné dans un environnement de production afin qu’il puisse effectuer des prévisions sur de nouvelles données en temps réel. Cela implique de mettre en place l’infrastructure appropriée, comme des serveurs et des API, pour permettre au modèle de communiquer avec les utilisateurs ou d’autres systèmes. Le déploiement nécessite également d’évaluer les performances du modèle dans le monde réel et d’effectuer les ajustements nécessaires. Par exemple, le système de recommandation d’un site de commerce électronique suggère régulièrement des produits aux consommateurs en fonction de leur historique de navigation.

Advertisement

Composants d’un modèle de machine learning

Les frameworks de machine learning utilisent des langages logiciels tels que TensorFlow et PyTorch pour produire un modèle exploitable. Un modèle de machine learning comprend trois composants distincts :

  • Processus de décision : un système ingère les données et utilise un algorithme de machine learning pour classer et prédire des événements.
  • Fonction d’erreur : cette fonctionnalité intégrée permet au modèle d’évaluer l’exactitude et la qualité des prédictions.
  • Processus d’optimisation du modèle : cette fonctionnalité permet aux modèles de ML de s’adapter en trouvant des données qui correspondent mieux à l’ensemble d’entraînement ; à mesure que le modèle évolue, le système continue de s’évaluer et de s’affiner pour atteindre ses objectifs de précision.

7 types de machine learning

Il existe sept types de ML, chacun possédant ses propres caractéristiques et applications, qui l’aident à développer et à améliorer ses capacités de prédiction des données. Leur utilisation peut contribuer à gérer la production de grandes quantités de données et les jeux de données.

Apprentissage supervisé

Dans l’apprentissage supervisé, les machines sont entraînées sur des jeux de données étiquetés afin que les systèmes puissent prédire des résultats à partir de leurs données d’entraînement. Chaque échantillon d’entraînement contient des paires entrée-sortie, ce qui permet au modèle d’apprendre la correspondance entre les entrées et les sorties. Cette méthode est couramment utilisée pour les tâches de classification et de régression, comme la détection des courriers indésirables, la reconnaissance d’images et la maintenance prédictive.

Apprentissage non supervisé

L’apprentissage non supervisé fonctionne avec des données non étiquetées. Le système tente de trouver des schémas et des relations dans les données sans connaissance préalable des résultats. Parmi les stratégies courantes figurent le clustering (regroupement de points de données similaires) et l’analyse des associations (recherche de règles décrivant de grandes parties des données). Ses applications comprennent la segmentation des clients, la détection des anomalies et l’analyse du panier d’achat.

Apprentissage semi-supervisé

L’apprentissage semi-supervisé est une technique qui combine des éléments de l’apprentissage supervisé et de l’apprentissage non supervisé. Il associe un petit ensemble de données étiquetées à un volume bien plus important de données non étiquetées. Cette méthode est particulièrement utile lorsque l’étiquetage des données est coûteux ou chronophage, car elle permet de tirer le meilleur parti d’une grande quantité de données non étiquetées pour améliorer la précision du modèle. L’apprentissage semi-supervisé est couramment utilisé pour la catégorisation de contenus en ligne et l’analyse d’images médicales, lorsque l’acquisition de données étiquetées est difficile, mais que les données non étiquetées sont facilement disponibles.

Apprentissage par renforcement

L’apprentissage par renforcement repose sur l’essai et l’erreur : un agent interagit avec son environnement pour recueillir des informations et prendre des décisions. L’agent est récompensé ou pénalisé en fonction de ses actions et apprend à optimiser les récompenses cumulées au fil du temps. Ce type d’apprentissage est particulièrement utile dans les situations impliquant des décisions séquentielles, comme les jeux vidéo, le contrôle robotique et la conduite autonome.

Apprentissage auto-supervisé

L’apprentissage auto-supervisé utilise des approches non supervisées pour résoudre des problèmes qui nécessitent traditionnellement un apprentissage supervisé. Plutôt que d’utiliser des étiquettes explicites, il produit des étiquettes implicites à partir d’entrées non structurées, ce qui permet au modèle d’apprendre de manière autonome des représentations et des caractéristiques. Cette approche gagne en popularité dans des domaines tels que le traitement du langage naturel (NLP) et la vision par ordinateur, où le pré-entraînement de modèles sur de grands jeux de données peut améliorer considérablement leurs performances.

Machine learning en ligne

Le machine learning en ligne permet aux modèles d’apprendre progressivement à partir d’un flux continu de points de données en temps réel. Les paramètres du modèle sont constamment mis à jour à mesure que de nouvelles données arrivent, ce qui lui permet de s’adapter à l’évolution des situations et de produire des prédictions en temps réel. Ses applications comprennent la détection des fraudes, les systèmes de recommandation en temps réel et les interfaces utilisateur adaptatives.

Apprentissage par lots

L’apprentissage par lots consiste à entraîner des modèles sur de grandes quantités de données accumulées. L’algorithme ne met pas à jour ses paramètres tant que le lot complet n’a pas été traité, ce qui nécessite une quantité importante de ressources informatiques telles que le processeur, la RAM et les entrées-sorties disque. Cette méthode convient aux situations dans lesquelles les données évoluent peu, comme la modélisation prédictive hors ligne et le traitement de données à grande échelle.

Frameworks et méthodes de machine learning

Le machine learning repose sur plusieurs frameworks algorithmiques fondamentaux pour obtenir des résultats et produire des modèles utiles, notamment les réseaux neuronaux, la régression linéaire et logistique, le clustering, les arbres de décision et les forêts aléatoires.

Réseaux neuronaux

Les réseaux neuronaux sont des algorithmes d’intelligence artificielle conçus pour simuler le fonctionnement du cerveau humain. Ils utilisent des données d’entraînement pour repérer des schémas et apprennent généralement rapidement, en s’appuyant sur des milliers, voire des millions, de nœuds de traitement. Ils sont idéaux pour reconnaître des schémas et sont largement utilisés pour la reconnaissance vocale, le traitement du langage naturel, la reconnaissance d’images, l’analyse du comportement des consommateurs et les prévisions financières.

Régression linéaire

Cette technique identifie les relations entre des variables d’entrée indépendantes et au moins une variable cible. Utile pour prédire des valeurs numériques, comme les prix des billets d’avion ou la valeur de biens immobiliers — généralement sur une période de plusieurs semaines ou mois —, elle peut faire apparaître les hausses et les baisses de prix ou de valeur prévues dans un jeu de données complexe.

A linear regression graph sample.
Linear regression graph showing the relationship between two variables.

Graphique de régression linéaire montrant la relation entre deux variables.

Régression logistique

Cette méthode utilise généralement un modèle de classification binaire (comme « oui/non ») pour déterminer ou catégoriser la probabilité qu’un événement se produise. Elle analyse un jeu de données afin d’identifier les poids et les biais qui peuvent être intégrés au modèle ou en être exclus. Une utilisation courante de cette technologie consiste à identifier les courriers indésirables et à mettre sur liste noire les codes logiciels indésirables ou les logiciels malveillants.

A nonlinear polynomial regression graph sample.
A nonlinear polynomial regression graph showing a relationship between independent and dependent variables.

Graphique de régression polynomiale non linéaire montrant la relation entre des variables indépendantes et dépendantes.

Clustering

Cet outil de ML utilise l’apprentissage non supervisé pour repérer des schémas et des relations que les humains peuvent ne pas déceler. Le clustering peut par exemple servir à évaluer les performances d’un fournisseur pour un même produit dans différents établissements. Cette approche pourrait être utilisée dans le secteur de la santé pour comprendre l’incidence de différentes conditions de vie sur la santé et la longévité. Elle peut également servir à détecter des tendances sur les sites web et les réseaux sociaux, notamment pour déterminer quels textes, images et vidéos afficher.

Arbre de décision

Cette approche d’apprentissage supervisé construit une structure de données composée de nœuds qui confrontent une idée ou un concept à un ensemble de données d’entrée. Un arbre de décision fournit des valeurs numériques, mais assure également certaines fonctions de classification pour aider les utilisateurs à comprendre visuellement les données. Contrairement à d’autres formes de ML, il permet d’examiner et d’auditer les résultats. Dans le monde de l’entreprise, les arbres de décision servent souvent à élaborer des analyses et des prévisions concernant une réduction ou une expansion des effectifs, la modification d’un modèle de tarification ou la planification de la succession.

A type of decision tree algorithm known as a classification tree.
A type of decision tree algorithm known as a classification tree.

Un type d’algorithme d’arbre de décision appelé arbre de classification.

Forêt aléatoire

Un modèle de forêt aléatoire intègre simultanément plusieurs modèles d’arbres de décision. La combinaison d’arbres de décision permet de classifier des variables catégorielles ou d’effectuer la régression de variables continues, formant ce que l’on appelle un ensemble. Il devient ainsi possible d’utiliser différents arbres pour produire des prédictions spécifiques, puis de combiner ces prédictions en un ensemble ou modèle global unique. Un outil de ML fondé sur un algorithme de forêt aléatoire peut par exemple être utilisé dans un système de recommandation.

Sources de données d’entraînement pour le machine learning

Les données d’entraînement constituent un élément important du machine learning. Lors du choix des sources de données, il convient de tenir compte de leur qualité, de leur pertinence pour votre cas d’usage particulier, ainsi que des éventuelles considérations juridiques ou éthiques liées à leur utilisation.

Jeux de données publics

Les jeux de données publics sont souvent partagés par des établissements scolaires, des hôpitaux, des organisations, des chercheurs ou des organismes publics afin de promouvoir la transparence et de faciliter la recherche. Ils couvrent généralement un large éventail de sujets et sont partagés sous des licences ouvertes telles que Creative Commons, qui permettent leur réutilisation sous certaines conditions. Parmi les sources courantes de jeux de données publics figurent les suivantes :

  • Kaggle : Une collection diversifiée de jeux de données dans des domaines comme la santé, la finance et le traitement du langage naturel, Kaggle organise des concours afin de fournir davantage de contexte et de structuration pour l’utilisation des données.
  • UCI Machine Learning Repository : La School of Information and Computer Sciences de l’University of California, Irvine, propose des jeux de données pour la classification, la régression et le clustering, accompagnés de descriptions détaillées et de références de performance.
  • Google Dataset Search : Google Dataset Search regroupe des jeux de données provenant de diverses plateformes et divers référentiels, afin de les rendre facilement accessibles aux utilisateurs.
  • Référentiels universitaires : Les universités et les laboratoires de recherche partagent fréquemment des jeux de données dans le cadre de leurs publications et de leurs projets.

Jeux de données propriétaires

Les entités privées sont souvent propriétaires de jeux de données qui peuvent être achetés ou faire l’objet d’une licence. Les coûts varient considérablement selon la taille, la qualité et l’exclusivité du jeu de données. Ces jeux de données sont généralement adaptés à des secteurs ou applications précis, ce qui leur confère une grande valeur pour certains cas d’usage du machine learning et de la science des données. Parmi les sources courantes de jeux de données propriétaires figurent les suivantes :

  • Données propres à l’entreprise : Les entreprises peuvent recueillir des données privées issues des interactions avec les utilisateurs, des enregistrements transactionnels ou de capteurs IoT.
  • Fournisseurs de données commerciales : Des fournisseurs de données commerciales tels que Nielsen et Experian proposent à l’achat de vastes jeux de données soigneusement sélectionnés.

Données issues du crowdsourcing

Les données issues du crowdsourcing sont collectées auprès d’un groupe vaste et diversifié de personnes selon différentes approches. Bien que leur qualité puisse varier, leur diversité peut être bénéfique au machine learning. La multiplicité des contributions permet au système d’identifier des corrélations et de créer un jeu de données complet pouvant servir à concevoir des modèles robustes. Parmi les sources courantes de données issues du crowdsourcing figurent les suivantes :

  • Amazon Mechanical Turk : La place de marché de crowdsourcing Amazon Mechanical Turk permet de recueillir des données étiquetées en répartissant les tâches entre un grand nombre de personnes. Elle est utile pour les tâches nécessitant des décisions humaines, comme l’annotation d’images ou l’analyse des sentiments.
  • Forums de réseaux sociaux : Les réseaux sociaux et autres forums en ligne recueillent des données pouvant servir à recueillir des opinions, à repérer des tendances et à analyser la manière dont les utilisateurs interagissent avec un sujet social donné, notamment pour l’analyse des sentiments, la prévision des tendances et d’autres analyses sociales utilisables en marketing ou dans le développement de produits.

Données synthétiques

Données synthétiques utilisées pour simuler des données du monde réel. Elles sont générées par un algorithme et utilisées uniquement lorsque les données réelles sont limitées ou rares, ou lorsque des préoccupations liées à la confidentialité se posent. Des techniques telles que les réseaux antagonistes génératifs (GAN) et d’autres méthodes d’augmentation des données servent à simuler intégralement les données nécessaires.

Cas d’usage du machine learning dans les secteurs d’activité

Le machine learning a transformé un grand nombre d’entreprises en permettant une prise de décision fondée sur les données, l’automatisation des processus et la découverte d’informations jusque-là inconnues dans des secteurs aussi variés que l’énergie, l’assurance, la FinTech, la santé, le marketing et bien d’autres. Voici quelques-uns des cas d’usage les plus courants :

  • Secteur de l’énergie : Le machine learning sert à optimiser la production, la distribution et la consommation, en contribuant à planifier la maintenance prédictive et à gérer le contrôle de la charge énergétique. Les algorithmes peuvent examiner les données des capteurs afin d’identifier les problèmes des équipements avant qu’ils ne surviennent, pour réduire les temps d’arrêt et les coûts de maintenance, et contribuer à équilibrer l’offre et la demande sur le réseau en prédisant les tendances de consommation et en modifiant la distribution.
  • Assurance : Le machine learning sert à analyser les risques, à détecter les fraudes et à fournir des recommandations de polices personnalisées en évaluant les données historiques. Les modèles peuvent anticiper la probabilité de sinistres et détecter les activités frauduleuses, ce qui permet aux assureurs de proposer une tarification plus précise et de réduire les pertes dues à la fraude.
  • FinTech et services bancaires : Dans la fintech et le secteur bancaire, le ML améliore la détection des fraudes, le service client et les conseils financiers personnalisés en utilisant des algorithmes pour évaluer les schémas transactionnels, identifier les anomalies et prévenir les fraudes. Les chatbots reposant sur le ML fournissent rapidement un service client, résolvant les demandes simples tout en permettant aux agents humains de traiter les situations plus complexes.
  • Santé : Le machine learning peut améliorer le diagnostic par imagerie médicale et contribuer à personnaliser les plans de traitement en analysant les données des patients, ce qui permet des traitements de santé plus efficaces et mieux adaptés. Il améliore le fonctionnement des hôpitaux en anticipant les admissions de patients, les besoins en ressources et la planification, contribuant ainsi à accroître la productivité et à améliorer la prise en charge des patients.
  • Secteur public : L’analyse prédictive peut contribuer à prévenir la criminalité en identifiant les zones à risque et en déployant efficacement les ressources, tandis que les systèmes de gestion du trafic surveillent la circulation et réduisent les embouteillages. Les modèles de ML examinent également les sources de données afin de prévoir et de gérer les effets des catastrophes naturelles, pour améliorer la préparation et les interventions.
  • Service client : Le machine learning améliore le service client en automatisant les réponses, en accroissant la satisfaction des clients et en réduisant les coûts d’exploitation. Les chatbots et les assistants virtuels répondent aux questions courantes, permettant aux agents humains de se consacrer à des situations plus complexes nécessitant leur expertise.
  • Ventes :Les équipes commerciales peuvent utiliser le ML pour prédire le comportement des clients, optimiser les stratégies tarifaires et améliorer la qualification des prospects. Les algorithmes de ML prédisent les tendances futures des ventes, proposent une tarification idéale et identifient les prospects à fort potentiel en analysant les données de ventes antérieures — ce qui améliore le chiffre d’affaires des ventes en concentrant les efforts sur les opportunités les plus prometteuses et en fixant des prix compétitifs pour les produits, en fonction de la demande du marché et des tendances du comportement des consommateurs.
  • Marketing : Les professionnels du marketing utilisent le machine learning pour personnaliser les publicités, prévoir les tendances potentielles et optimiser les dépenses publicitaires. Les données clients sont analysées afin de générer des campagnes marketing personnalisées, de prévoir les futures tendances du marché et de mieux répartir les dépenses publicitaires, ce qui augmente le ROI grâce à un marketing plus ciblé.
  • Fidélisation des employés : Le ML peut identifier les caractéristiques qui contribuent au turnover du personnel et proposer des solutions de fidélisation en examinant les données des employés pour prédire lesquels sont susceptibles de partir et proposer des mesures visant à accroître la satisfaction au travail et la fidélisation. Il s’agit notamment de repérer les tendances en matière de satisfaction professionnelle, d’équilibre entre vie professionnelle et vie privée et d’évolution de carrière, afin d’aider les organisations à résoudre les problèmes liés à l’amélioration de la fidélisation des employés.

Enjeux éthiques et juridiques du machine learning

L’utilisation éthique du ML doit donner la priorité au consentement éclairé, à l’anonymat, à l’équité et à la transparence. Le respect des réglementations sur la protection des données, la prévention des violations, la préservation du droit à l’oubli et la gestion des transferts de données transfrontaliers sont autant d’éléments importants ; il est essentiel de concilier l’innovation avec ces enjeux pour garantir une utilisation appropriée et légale de cette technologie.

Enjeux liés à la confidentialité des données

Des réglementations telles que le Règlement général sur la protection des données (RGPD) et le California Consumer Privacy Act (CCPA) imposent des exigences strictes en matière de gestion des données personnelles, assorties de lourdes sanctions en cas de non-conformité. Les organisations doivent protéger leurs données contre les violations, car les conséquences juridiques comprennent de lourdes amendes et une atteinte à leur réputation. Les individus peuvent demander la suppression de leurs données en vertu de lois qui imposent cette suppression aux modèles de machine learning, ce qui peut être techniquement complexe. En outre, les transferts de données au-delà des frontières posent des difficultés juridiques en raison des différences entre les législations sur la protection des données d’une juridiction à l’autre.

Biais et équité

Les biais présents dans les modèles de machine learning peuvent entraîner un traitement inéquitable des individus en fonction de leur origine ethnique, de leur genre ou d’autres caractéristiques. Garantir l’équité nécessite une surveillance et des ajustements continus afin d’éviter de perpétuer les inégalités existantes. Pour obtenir des résultats équitables pour tous les utilisateurs, il convient d’utiliser des jeux de données diversifiés et des algorithmes capables de détecter et d’atténuer les biais.

Responsabilité et transparence

Les systèmes de machine learning doivent être responsables et transparents afin de susciter la confiance et de garantir des pratiques éthiques. Cela implique de documenter explicitement la manière dont les modèles sont créés, entraînés et évalués, ainsi que d’expliquer leurs décisions. La transparence permet aux parties prenantes de comprendre les résultats des systèmes de machine learning et d’en débattre, favorisant ainsi une plus grande responsabilité dans leur mise en œuvre.

Cadres réglementaires

À mesure que la technologie du machine learning évolue, les cadres réglementaires qui encadrent son utilisation évoluent eux aussi. Les nouvelles réglementations visent à répondre aux enjeux éthiques et juridiques associés à l’IA et au machine learning, en fournissant des lignes directrices et des normes pour une utilisation responsable. Les organisations doivent se tenir informées de ces réglementations et veiller à les respecter afin d’éviter les problèmes juridiques et de préserver la confiance du public.

FAQ

Quelle quantité de données faut-il pour entraîner un modèle de machine learning ?

La qualité des données nécessaires à l’entraînement d’un modèle de machine learning varie selon la complexité du problème, le modèle utilisé et le niveau de précision recherché. Les problèmes complexes, comme la classification d’images, nécessitent parfois de vastes jeux de données, pouvant atteindre plusieurs dizaines de milliers d’éléments. À l’inverse, les tâches plus simples peuvent nécessiter moins de points de données. Les modèles plus complexes, tels que les réseaux neuronaux profonds, requièrent généralement davantage de données pour atteindre leurs performances maximales, tandis que des modèles plus simples, comme la régression linéaire, peuvent être performants avec moins de données. En outre, une règle générale consiste à disposer d’au moins 10 fois plus de points de données que de caractéristiques ; des exigences de précision plus élevées impliquent souvent de disposer de davantage de données.

Quelles sont les règles d’or du machine learning ?

Le maintien d’un pipeline de données solide, la définition d’objectifs clairs et réalistes, le démarrage avec des caractéristiques simples, ainsi que l’évaluation et la maintenance régulières des performances du modèle sont autant de règles d’or importantes pour un machine learning efficace. Pour limiter le surapprentissage, l’infrastructure doit être testée séparément des modèles de machine learning, au moyen d’approches telles que la validation croisée. Le respect de ces recommandations contribue à garantir que le modèle fonctionne efficacement et reste fiable dans le temps.

Quelle est la différence entre l’IA et le ML ?

L’IA est un vaste domaine qui englobe diverses approches conçues pour simuler l’intelligence humaine, notamment le raisonnement et la résolution de problèmes. Elle comprend des sous-domaines tels que le traitement du langage naturel et la robotique. Le ML est un sous-domaine de l’IA qui se concentre sur la création d’algorithmes permettant aux ordinateurs d’apprendre à partir de données et d’effectuer des prédictions. Si le ML est une forme d’IA, toute l’IA ne repose pas sur le ML.

En conclusion : le machine learning va devenir toujours plus facile et performant à utiliser

Les progrès rapides de la technologie du ML garantissent qu’elle jouera un rôle de plus en plus important dans la définition des activités des entreprises au cours des prochaines années, en influençant des secteurs aussi divers que l’agriculture, la finance, l’industrie manufacturière, les transports, le marketing, le service client et la cybersécurité. Le machine learning contribuera également aux programmes environnementaux, sociaux et de gouvernance (ESG) des entreprises, ainsi qu’aux initiatives de développement durable qui concernent l’approvisionnement, les chaînes logistiques et les émissions de Scope 3 qui remontent jusqu’aux fournisseurs de matières premières et de composants.

Les systèmes de machine learning deviennent plus faciles à utiliser et à gérer. Ils s’intègrent donc plus profondément dans les organisations et dépassent le périmètre des data scientists. Alors que les organisations cherchent à réduire les coûts, à accroître la productivité, à superviser les programmes ESG, à construire des usines intelligentes, à mieux gérer les chaînes logistiques et à stimuler l’innovation à grande échelle, le ML continuera de s’imposer comme un outil essentiel.

Consultez notre guide sur l’IA et l’éthique pour en savoir plus sur les implications de cette technologie dynamique et puissante.

Kathryn Timonera

Datamation and eWeek staff writer Kathryn Pearl Timonera has covered a wide range of industries in her career, including technology, cybersecurity, e-commerce, and programming. Kathryn now applies her talent for presenting information to technology and cybersecurity professionals.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Propriété de TechnologyAdvice. © 2026 TechnologyAdvice. Tous droits réservés

Divulgation publicitaire : Certains des produits qui apparaissent sur ce site proviennent d'entreprises dont TechnologyAdvice reçoit une compensation. Cette compensation peut influencer la façon dont les produits apparaissent sur ce site, notamment l'ordre dans lequel ils apparaissent. TechnologyAdvice n'inclut pas toutes les entreprises ou tous les types de produits disponibles sur le marché.