La régression linéaire est peut-être l’algorithme de machine learning (ML) le plus basique et le plus accessible, mais c’est aussi l’un des plus rapides et des plus puissants. C’est pourquoi les professionnels des entreprises, des sciences et du monde universitaire s’appuient souvent sur cette méthode largement utilisée pour l’analyse prédictive. Comprendre le fonctionnement de la régression linéaire, ses types et ses caractéristiques, ses principaux avantages et ses principales applications dans divers domaines peut vous aider à en tirer le meilleur parti dans votre entreprise.
- POINTS CLÉS À RETENIR
- Qu’est-ce que la régression linéaire et comment fonctionne-t-elle ?
- Fonctionnement de la régression linéaire
- Variables indépendantes et dépendantes dans la régression linéaire
- Quatre types de régression linéaire
- Principales hypothèses et limites de la régression linéaire
- Applications de la régression linéaire dans divers domaines
- Logiciels de régression linéaire
- Problèmes courants et solutions liés à la régression linéaire
- En résumé : libérez la puissance de la régression linéaire
POINTS CLÉS À RETENIR
- •Les trois types de régression linéaire comprennent la régression simple (ou univariée), multiple et polynomiale. (Accéder à la section)
- •La régression linéaire est utilisée dans divers domaines, des entreprises et de l’économie aux soins de santé et aux sciences sociales. (Accéder à la section)
- •Des méthodes efficaces permettent de résoudre les problèmes courants liés à l’utilisation de modèles de régression linéaire. (Accéder à la section)
Qu’est-ce que la régression linéaire et comment fonctionne-t-elle ?
À son niveau le plus élémentaire, la régression linéaire s’appuie sur une variable — la variable indépendante — pour prédire la valeur d’une autre variable : la variable dépendante. Cette formule simple permettant d’effectuer des prédictions précises permet de créer une intelligence artificielle hautement explicable (XAI) qui peut être entraînée rapidement.
Elle trouve son origine dans le développement de méthodes statistiques destinées à analyser les mensurations humaines, dont le pionnier fut le naturaliste et généticien comportemental de l’époque victorienne Sir Francis Galton. En étudiant les tailles respectives des pères et de leurs fils, Galton a observé que la progéniture avait tendance à moins s’écarter de la taille moyenne de la population que ses parents, même si les pères plus grands que la moyenne avaient généralement des fils plus grands que la moyenne.
Ce phénomène statistique — la « régression vers la moyenne » — signifie que lorsqu’une valeur d’échantillon d’une variable aléatoire est extrême, les échantillons suivants de cette même variable aléatoire se rapprocheront de la moyenne de la population.
Fonctionnement de la régression linéaire
La régression linéaire repose sur l’hypothèse que lorsque des résultats extrêmes sont observés dans des échantillons de données aléatoires, des points de données plus normaux sont susceptibles de suivre — et qu’une droite peut être ajustée entre les points de données représentés. Cette droite peut servir de référence pour réduire au minimum les écarts entre les valeurs prédites et les valeurs réelles de sortie. En outre, des méthodes statistiques peuvent être dérivées de l’analyse de régression afin d’estimer les relations entre les variables dépendantes et une ou plusieurs variables indépendantes.
Le phénomène de régression vers la moyenne s’applique à pratiquement tout attribut mesurable des parents et de leur progéniture. Les statisticiens le considèrent comme un fait mathématique de la variation naturelle dans les données répétées et s’appuient sur ce principe pour réduire les différences inattendues entre les valeurs prédites et les valeurs réelles de sortie.

Variables indépendantes et dépendantes dans la régression linéaire
Dans l’analyse de régression, la variable de résultat est la variable dépendante, tandis que la variable de confusion est la variable prédictive, ou indépendante. En termes plus simples, la variable indépendante X est la cause et la variable dépendante Y est l’effet. Par exemple, les données observées dans les recherches de Galton semblaient indiquer une association entre deux variables — la taille d’un père et celle de son fils —, de sorte que la grande taille du père (X) devait généralement entraîner une grande taille du fils (Y).
Dans un graphique de régression linéaire, la droite représente la meilleure tentative pour réduire au minimum la somme des carrés des résidus entre les points de données connus ou observés et les points de données prédits. C’est pourquoi la droite de régression est également appelée droite d’ajustement, et la méthode utilisée pour cet ajustement est appelée méthode des moindres carrés.
Comprendre la corrélation entre les variables
La droite de régression indique où les points de données moyens sont censés se situer. En analysant la direction de la droite et la dispersion des points de données autour de celle-ci, vous pouvez tirer des conclusions sur l’association entre les variables. La figure ci-dessous présente les quatre principaux scénarios dans lesquels une variable continue est représentée sur l’axe X et l’autre sur l’axe Y.
Scénario 1 représente une forte corrélation positive entre les variables X et Y, tandis que le scénario 2 représente une faible corrélation positive. Dans les deux cas, la droite de régression est orientée vers le haut, de gauche à droite. Les observations de Galton sont un exemple de corrélation positive : une augmentation de la taille du père est corrélée à une augmentation de la taille du fils. Le scénario 3illustre l’absence de corrélation entre les variables X et Y. Dans ce cas, la droite de régression est horizontale. Le scénario 4 illustre une forte corrélation négative, avec une droite de régression orientée vers le bas, de gauche à droite. Par exemple, le nombre d’heures consacrées à l’exercice peut être négativement corrélé au poids, car une augmentation de l’activité physique peut entraîner une perte de poids.

Estimation des coefficients et prédiction des valeurs
L’équation y = mx +b représente l’équation de régression linéaire la plus élémentaire :
- x est la variable prédictive ou indépendante
- y est la variable dépendante ou la variable à déterminer
- m est la pente estimée de la droite de régression
- b est l’ordonnée à l’origine estimée, à l’endroit où la droite de régression croise l’axe y lorsque x est égal à 0
Dans cette équation de régression linéaire élémentaire, déterminer m vous indiquerait le taux de variation entre x et y; m est défini comme le principal coefficient de régression, ou paramètre inconnu décrivant la relation entre x et y. Autrement dit, si vous connaissez la valeur de m, vous pouvez prédire la valeur de y à partir d’une valeur connue de x.
Quatre types de régression linéaire
Les quatre types de régression linéaire les plus courants sont la régression simple, multiple et polynomiale. Comprendre leurs différences peut vous aider à déterminer l’approche la mieux adaptée à vos besoins :
- Régression linéaire simple : Le modèle de régression linéaire le plus basique décrit la corrélation entre une variable indépendante et une variable dépendante au moyen d’une droite de régression qui représente la relation linéaire entre les deux variables.
- Régression linéaire multiple : La régression linéaire multiple décrit la corrélation entre deux variables indépendantes ou plus et une variable dépendante, également au moyen d’une droite de régression.
- Régression polynomiale et autres variantes : La régression polynomiale exprime la relation entre les variables dépendante et indépendantes sous la forme d’un polynôme de degré n — par exemple, ax². Dans ce cas, la droite de régression est courbe plutôt que droite.
- Régression logistique : La régression logistique utilise les variables indépendantes pour estimer la probabilité qu’un événement se produise (0 ou 1). Au lieu de prédire une quantité ou un nombre continu, ce type d’analyse de régression catégorise les données d’entrée en groupes ou classes prédéfinis. Comme son nom l’indique, la régression logistique utilise des fonctions logarithmiques pour calculer la droite de régression.

Principales hypothèses et limites de la régression linéaire
La régression linéaire repose sur plusieurs hypothèses qui servent de lignes directrices quant à ses capacités. Dans de nombreux cas, il est facile de repérer les violations des hypothèses du modèle en appliquant différents graphiques et en les inspectant visuellement. Par exemple, vous pouvez vérifier la linéarité en observant le graphique de régression : si une courbe est visible, la relation entre les variables n’est peut-être pas linéaire. Vous pouvez également détecter les valeurs aberrantes d’un jeu de données en observant simplement son graphique, s’il est de petite taille.
La détection d’autres violations des hypothèses du modèle peut nécessiter une analyse visuelle plus poussée ou différents types de graphiques. Par exemple, pour vérifier l’homoscédasticité, vous pouvez représenter les résidus en fonction des valeurs ajustées : si les résidus s’écartent ou se rapprochent en éventail, indiquant une vitesse croissante ou décroissante, le jeu de données n’est probablement pas homoscédastique.
Linéarité et indépendance des observations
La régression linéaire présuppose l’existence d’une relation linéaire entre les variables indépendante et dépendante. Les professionnels des données effectuent généralement cette détermination à l’aide d’un nuage de points — un ensemble arbitraire de points de données x et y — afin de vérifier si les données s’alignent sur une droite.
Homoscédasticité et normalité des résidus
La régression linéaire présuppose également que les variances des différents groupes comparés sont égales ou similaires. Cette condition est essentielle pour garantir la précision des analyses de régression. Pour mesurer la précision des prédictions, les professionnels des données utilisent la normalité des résidus — c’est-à-dire qu’ils mesurent la différence entre les données observées et la valeur prédite afin de vérifier qu’elles suivent une distribution normale.
Absence de multicolinéarité
La multicolinéarité est une situation problématique dans laquelle les variables indépendantes d’un modèle de régression sont corrélées. Lorsque les variables indépendantes d’une régression linéaire sont fortement corrélées, des problèmes d’ajustement du modèle et des erreurs de prédiction peuvent survenir — en substance, l’erreur standard des coefficients augmente.
Relations non linéaires
La régression logistique a été présentée précédemment comme un moyen de prédire l’appartenance à une classe ; pour cela, les modèles doivent être ajustés afin de capturer la courbure des jeux de données. L’application de transformations logarithmiques, de racine carrée ou réciproques aux variables indépendantes et/ou dépendantes convertit effectivement la prédiction de valeurs continues en valeurs discrètes.
Valeurs aberrantes et anomalies
Tout jeu de données de taille importante comporte inévitablement des valeurs aberrantes et des anomalies. Même si la première tentation est de les supprimer, évitez de les écarter purement et simplement si elles ne peuvent pas être attribuées à une erreur. Leur suppression peut introduire inutilement un biais dans votre science des données et rendre vos prédictions moins précises. Traitez plutôt les valeurs aberrantes à l’aide de méthodes telles que le plafonnement et le plancher fondés sur les quantiles — qui plafonnent les valeurs aberrantes à une certaine valeur au-dessus du 90e percentile ou les ramènent à un facteur inférieur au 10e percentile —, ou l’imputation par la moyenne ou la médiane, qui remplace les valeurs aberrantes par la valeur médiane.
Applications de la régression linéaire dans divers domaines
Les entreprises de nombreux secteurs utilisent la régression linéaire pour un large éventail d’applications. En voici quelques-unes parmi les plus courantes :
- Prévision des ventes et des tendances du marché : En entreprise et en économie, les prévisions consistent à utiliser la régression linéaire pour analyser les variables dépendantes et indépendantes afin de prédire les chiffres de vente futurs.
- Analyse des tendances des maladies : Les professionnels de santé utilisent la régression linéaire pour déterminer les relations entre les facteurs liés aux patients et l’évolution des maladies, afin d’améliorer la prise en charge des patients et la pratique clinique. Par exemple, les cliniciens peuvent prédire la durée du séjour d’un patient à l’hôpital à partir de mesures cliniques, de données relatives au traitement et de données démographiques sur le patient.
- Compréhension des tendances comportementales : Dans les sciences sociales et l’éducation, la régression linéaire est couramment utilisée pour comprendre les relations de cause à effet au sein de groupes sociaux ou démographiques, chez les apprenants et chez les consommateurs de médias. Par exemple, les chercheurs peuvent utiliser la régression linéaire pour analyser les tendances des réseaux sociaux, les relations entre différentes variables et leurs effets sur le comportement humain — par exemple, le nombre d’heures passées en ligne et le niveau de satisfaction professionnelle.
Logiciels de régression linéaire
Le marché regorge d’outils et de logiciels pilotés par l’IA qui peuvent vous aider à effectuer une analyse de régression linéaire sur des données et à les visualiser pour en faciliter la compréhension. Nous recommandons Alteryx, IBM SPSS et SAS.
Alteryx
Alteryx est une plateforme d’analyse basée sur l’IA très appréciée des professionnels des données, qui leur permet d’accéder rapidement aux données, de les manipuler, de les analyser et de les restituer. La plateforme Designer de l’entreprise fournit un outil de régression linéaire permettant de créer des modèles simples pour estimer des valeurs ou évaluer les relations entre les variables en fonction de leurs corrélations linéaires. La plateforme Designer Cloud d’Alteryx est proposée à partir de 4 950 dollars US, tandis que Designer Desktop est proposée à partir de 5 195 dollars US.


Alteryx Designer.
IBM SPSS
IBM SPSS est depuis longtemps l’un des outils préférés des professionnels des données pour effectuer des analyses statistiques et des techniques statistiques multivariées comme la régression linéaire. Le progiciel SPSS Statistics permet aux utilisateurs de tous niveaux d’expérience d’effectuer des analyses statistiques avancées. Le prix dépend des fonctionnalités et du nombre d’utilisateurs, mais l’abonnement de base commence à 1 069 dollars US par an pour un utilisateur.


IBM SPSS Statistics.
SAS
Avec IBM SPSS, SAS est un autre acteur incontournable et bien établi de l’analyse statistique et de l’analytique des données. Le système SAS fournit de nombreuses procédures de régression, notamment REG pour les régressions à usage général. L’entreprise ne publie pas ses tarifs, mais les fourchettes rapportées varient considérablement selon les fonctionnalités, le nombre d’utilisateurs et les modules complémentaires.


Un graphique de régression dans SAS.
Problèmes courants et solutions liés à la régression linéaire
La régression linéaire est un processus complexe qui peut produire de nombreux résultats positifs, mais qui peut également poser des difficultés à ceux qui souhaitent la mettre en œuvre. Voici un aperçu des problèmes les plus courants et de quelques solutions.
Remédier au surapprentissage et au sous-apprentissage
Le surapprentissage se produit lorsqu’un modèle est trop complexe, avec des paramètres superflus, et que la taille de l’échantillon est trop petite pour permettre des prédictions pertinentes. Les modèles de ML qui en résultent se généralisent mal à de nouvelles données. Le moyen le plus direct de limiter le surapprentissage consiste simplement à obtenir davantage de données afin d’améliorer la précision du modèle. À l’inverse, le sous-apprentissage se produit lorsque le modèle de ML n’est pas suffisamment complexe et ne parvient pas à trouver les relations et les schémas présents dans les données. Dans ces cas, vous pouvez accroître la complexité du modèle en augmentant le nombre de caractéristiques du jeu de données.
Combinaison de méthodes statistiques
Pour certains cas d’utilisation en analyse de données, vous devrez prédire à la fois une quantité ou un nombre continu et l’appartenance à une classe discrète. Dans ces scénarios, une approche courante consiste à développer à la fois un modèle de régression linéaire et un modèle de classification logistique avec le même jeu de données, puis à les déployer séquentiellement. Vous pouvez également développer un modèle à sorties multiples — un seul modèle de réseau neuronal capable de prédire à la fois une quantité continue et une valeur d’étiquette fondée sur une classe à partir des mêmes données d’entrée.
Amélioration des modèles prédictifs
Bien que la régression linéaire soit connue pour sa simplicité et son interprétabilité, elle peut également devenir complexe et difficile à gérer lorsqu’on lui incorpore plusieurs variables prédictives afin de capturer des relations complexes. Cela peut entraîner un surapprentissage et compromettre la capacité de votre modèle à se généraliser à de nouvelles données. Pour atténuer ces problèmes et améliorer vos modèles prédictifs, vous pouvez utiliser des techniques de régularisation comme la régression Ridge ou Lasso afin d’améliorer les performances, de remédier au surapprentissage et de garantir que vos modèles de régression linéaire restent robustes et se généralisent correctement à de nouvelles données.
Amélioration et validation de vos modèles
Comme pour tous les modèles prédictifs, vos modèles de régression linéaire doivent être constamment évalués et ajustés afin de garantir la précision de vos prédictions. Vous pouvez évaluer les performances et l’efficacité de votre modèle de régression à l’aide de diverses mesures quantitatives et métriques d’évaluation. En utilisant des métriques telles que l’erreur absolue moyenne (MAE), l’erreur quadratique moyenne (MSE), la racine de l’erreur quadratique moyenne (RMSE), l’erreur absolue moyenne en pourcentage (MAPE) et l’erreur absolue moyenne symétrique en pourcentage (SMAPE), vous pouvez mesurer efficacement la distance numérique entre vos valeurs réelles et vos valeurs prédites.
En résumé : libérez la puissance de la régression linéaire
La régression linéaire est une approche simple et fiable de l’analyse prédictive qui continue de servir de pilier à la science des données et à l’IA/au ML modernes. Malgré la multitude de développements et de techniques puissants en ML apparus ces dernières années, les professionnels des données s’appuient davantage sur cette technique simple et éprouvée pour effectuer des prédictions.
Pour en savoir plus sur les modèles de langage de grande taille qui propulsent l’intelligence artificielle avec notre guide consacré aux LLM.

