Qu’est-ce que la régression logistique ? Guide complet

Data analytics visualization.

Image: max_776/Adobe Stock

Written By
Leon Yen
Leon Yen
Nov 21, 2024
11 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

La régression logistique est une technique statistique utilisée pour déterminer la relation entre deux facteurs de données afin d’effectuer une prédiction binaire. Dans le monde de l’entreprise, cette catégorisation prend d’innombrables formes : prédire si un client cessera ou non d’acheter les produits d’une entreprise, ou déterminer s’il faut approuver ou non un prêt en fonction des caractéristiques de l’emprunteur. La régression logistique est également un algorithme fondamental en apprentissage automatique et en statistique. Comprendre ses principales applications et son fonctionnement peut aider votre organisation à apprendre à utiliser cette technique puissante. Voici ce qu’il faut savoir.

À RETENIR

  • La régression logistique utilise la fonction logit pour convertir les prédictions en probabilités. (Aller à la section)
  • Les modèles logistiques sont utilisés dans pratiquement tous les secteurs, notamment la santé, la finance et le marketing. (Aller à la section)
  • Les limites de la régression logistique, comme le surapprentissage, peuvent être atténuées grâce à des techniques telles que la régularisation. (Aller à la section)

Qu’est-ce que la régression logistique ?

La régression logistique est une technique statistique qui utilise un ensemble de variables indépendantes et une unique variable dépendante binaire pour estimer la probabilité qu’un événement donné se produise. Puisque le résultat prédit est une probabilité, la variable dépendante vaut 0 ou 1. On parle alors de transformation logit. La régression logistique permet donc de prédire deux scénarios possibles :

  • Un événement ne se produit pas (0)
  • Un événement se produit (1)

Par exemple, la régression logistique est couramment utilisée pour prédire si des clients ne rembourseront pas leurs prêts, afin d’évaluer leur solvabilité.

Advertisement

Fonctionnement de la régression logistique

La régression logistique utilise une fonction logistique à courbe sigmoïde (en forme de S) pour convertir des combinaisons linéaires de prédictions en probabilités. Les fonctions sigmoïdes convertissent toute valeur réelle en une probabilité comprise entre 0 et 1. Comprendre les composants et les concepts qui sous-tendent la régression logistique permet de mieux comprendre le fonctionnement global de cette technique.

A comparison of logistic functions.
A comparison of logistic functions.

Comparaison de fonctions logistiques.

Variables dépendantes et indépendantes

Les modèles de régression logistique comportent une variable dépendante et plusieurs variables prédictives indépendantes, catégorielles ou continues. Contrairement aux modèles de régression linéaire standard, la régression logistique n’exige pas de relation linéaire entre les variables indépendantes et dépendantes. L’homoscédasticité — une variance constante des termes d’erreur pour toutes les variables indépendantes — n’est pas requise. D’autres exigences s’appliquent toutefois selon le type de régression logistique. Pour une régression logistique binaire, les variables dépendantes doivent être binaires, tandis que la régression logistique ordinale exige des variables dépendantes ordinales — des variables qui apparaissent dans des catégories naturelles et ordonnées.

Log-cotes et fonction logit

Dans une régression logistique, la fonction logit associe un nombre à une probabilité. Ainsi, dans le cas d’un modèle de régression logistique binaire, la variable dépendante est le logit de p, où p représente la probabilité que les variables dépendantes aient la valeur 1. Les log-cotes permettent de représenter les chances — la probabilité qu’un événement se produise — au moyen d’une fonction logarithmique. Les log-cotes sont simplement le logarithme des cotes.

Estimation du maximum de vraisemblance

L’estimation du maximum de vraisemblance (MLE) est une méthode probabiliste largement utilisée pour estimer les paramètres d’un modèle de régression logistique. La MLE sélectionne les valeurs des paramètres du modèle qui maximisent la fonction de vraisemblance — autrement dit, les paramètres qui s’ajustent le mieux aux données.

Advertisement

Rapport de cotes et interprétation

Dans une régression logistique, le rapport de cotes représente l’effet constant d’une variable prédictive indépendante sur la probabilité qu’un résultat dépendant donné se produise. Un rapport supérieur à 1 indique une association positive ou des chances plus élevées d’obtenir le résultat, tandis qu’un rapport inférieur à 1 indique une association négative ou des chances plus faibles.

Hypothèses de la régression logistique

La régression logistique repose sur les hypothèses et exigences fondamentales suivantes :

  • La variable dépendante doit être binaire pour une régression logistique binaire et ordinale pour une régression logistique ordinale.
  • Les observations doivent être indépendantes les unes des autres et ne pas provenir de mesures répétées.
  • Les variables indépendantes ne doivent pas présenter de multicolinéarité, c’est-à-dire que deux variables indépendantes ou plus ne doivent pas être corrélées.
  • Les variables indépendantes doivent être linéairement liées aux log-cotes de la variable dépendante.
  • Le modèle de régression logistique a été créé à partir d’échantillons de grande taille.

Trois types de régression logistique

Voici trois des types de régression logistique les plus couramment utilisés :

  • Régression logistique binaire : La régression logistique binaire est utilisée lorsque la variable dépendante n’a que deux résultats ; elle est alors appelée variable dichotomique. Un scénario courant de régression logistique binaire consiste à prédire une valeur positive ou négative, ou une réponse oui/non.
  • Régression logistique multinomiale : La régression logistique multinomiale est utilisée lorsque la variable dépendante est nominale et comporte plus de deux catégories sans rang ni ordre. Autrement dit, elle sert à prédire si la variable dépendante appartient à plus de deux catégories.
  • Régression logistique ordinale : La régression logistique ordinale est utilisée pour effectuer des prédictions lorsqu’il existe trois catégories ou plus présentant un ordre naturel, mais pas nécessairement des intervalles réguliers. Les tâches de classement utilisent couramment la régression logistique ordinale, par exemple pour classer les performances d’un étudiant comme supérieures à la moyenne, moyennes ou inférieures à la moyenne.
Advertisement

Applications des modèles de régression logistique

La plupart des cas d’usage de la régression logistique impliquent une régression logistique binaire, qui détermine si un exemple appartient à une classe donnée. De nombreux problèmes pratiques nécessitent une prédiction simple par oui ou non, et la régression logistique fournit des prédictions rapides et précises, plus faciles à interpréter et efficaces sur le plan computationnel. En outre, les résultats binaires sont souvent faciles à mesurer et à collecter, et correspondent à de nombreux objectifs binaires dans les domaines de l’entreprise, de la santé et des technologies.

La régression logistique offre de nombreuses applications dans les domaines de la santé, de la finance et du marketing. En utilisant des modèles logistiques avec des variables prédictives indépendantes telles que le poids, les habitudes d’exercice et l’âge, les cardiologues peuvent par exemple déterminer la probabilité qu’un patient subisse un premier infarctus ou une récidive. Les modèles de régression logistique sont également largement utilisés dans la finance pour évaluer le risque de crédit des particuliers et des organisations qui demandent des prêts. Les spécialistes du marketing utilisent la régression logistique pour prédire les habitudes d’achat des clients à partir de facteurs prédictifs tels que l’âge, le lieu de résidence, les revenus et le niveau d’études.

Avantages et limites de la régression logistique

La régression logistique est très polyvalente et s’applique à un large éventail de domaines et de disciplines grâce à plusieurs avantages clés, dont le plus important est sa facilité d’utilisation et d’explication. Les modèles logistiques sont simples à mettre en œuvre, faciles à interpréter et peuvent être entraînés efficacement en peu de temps. Ils peuvent facilement être adaptés à plusieurs classes et à des modèles probabilistes, et leurs coefficients peuvent servir à montrer quelles caractéristiques sont les plus importantes. Les modèles prédictifs de régression logistique sont également moins sujets au surapprentissage, qui se produit lorsque le nombre d’observations dépasse le nombre de caractéristiques.

La régression logistique présente toutefois certaines limites. Les modèles logistiques reposent sur l’hypothèse d’une linéarité entre les variables indépendantes et les log-cotes de la variable dépendante. Cette hypothèse peut nuire aux performances du modèle dans les scénarios fortement non linéaires. Un surapprentissage peut également se produire si le nombre de caractéristiques dépasse le nombre d’observations, et la régression logistique ne fonctionne que lorsque la multicolinéarité entre les variables indépendantes est faible ou inexistante.

Advertisement

Évaluation des modèles de régression logistique : évaluer les performances et la précision

Les professionnels des données utilisent différentes méthodes statistiques pour évaluer les performances et la précision des modèles de régression logistique. Ces mesures sont souvent intégrées à des plateformes d’intelligence artificielle/apprentissage automatique (IA/AA) sous forme d’outils d’IA explicable (XAI), afin de comprendre les résultats des algorithmes d’apprentissage automatique et de renforcer la confiance dans leurs prédictions.

Matrices de confusion

Malgré son nom, une matrice de confusion résume clairement les performances d’un modèle de classification. Elle vise à révéler les types d’erreurs commises par un modèle — les situations dans lesquelles il peut « confondre » les classes. Comme la régression logistique est souvent appliquée à des tâches de classification binaire ou multiclasse, la matrice de confusion décompose ces prédictions en nombres de vrais positifs (TP), vrais négatifs (TN), faux positifs (FP) et faux négatifs (FN).

A confusion matrix for a cancer classification predictive model.
A confusion matrix for a cancer classification predictive model.

Matrice de confusion d’un modèle prédictif de classification du cancer.

Exactitude, précision et score F1

Les professionnels des données peuvent utiliser les nombres issus d’une matrice de confusion pour calculer l’exactitude, le rappel et le score F1 de leurs modèles de régression logistique.

  • Exactitude : L’exactitude, ou précision, se mesure en divisant le nombre de prédictions correctes — vrais positifs et vrais négatifs — par le nombre total de prédictions.

(TP + TN) / (TP + FP + TN + FN)

  • Précision : Également appelée rappel, sensibilité ou taux de vrais positifs, elle mesure la proportion de positifs réels, calculée en divisant le nombre de vrais positifs (TP) par le nombre de vrais positifs et de faux positifs.

TP / (TP + FP)

  • Score F1 : Ce score fournit une mesure unique et équilibrée de l’exactitude et du rappel en calculant la moyenne harmonique de ces deux valeurs.
Advertisement

2 * (précision + rappel / précision * rappel)

Courbe ROC et score AUC

La courbe ROC (receiver operating characteristic) et l’aire sous la courbe ROC (AUC) représentent les performances du modèle d’un classificateur de régression logistique en illustrant le compromis entre les taux de TP et de FP pour des critères de catégorisation donnés. Les professionnels des données peuvent observer visuellement la courbe ROC d’un modèle et calculer son score AUC afin d’évaluer sa précision et sa fiabilité. Un modèle plus performant présente un score AUC plus élevé.

A ROC curve.
A ROC curve.

Une courbe ROC.

Étapes et points à prendre en compte pour entraîner un modèle de régression logistique

La procédure d’entraînement d’un modèle de régression logistique est similaire à celle d’autres modèles prédictifs d’apprentissage automatique. Elle comprend les trois étapes principales suivantes :

  1. Préparation des données : Créez le jeu de données étiqueté avec les caractéristiques d’entrée (variables indépendantes) et les étiquettes de sortie (variables dépendantes), prétraitez les données, puis divisez-les en ensembles d’entraînement et de test.
  2. Initialisation et entraînement du modèle : À l’aide des données d’entraînement, déterminez les coefficients ou pondérations de chaque caractéristique qui minimisent la fonction de coût, puis procédez à la minimisation par descente de gradient.
  3. Évaluation du modèle : À l’aide des données de test, évaluez la précision du modèle en appliquant les méthodes d’évaluation présentées précédemment, telles que les matrices de confusion ou le score d’exactitude/de précision/F1.
  4. Effectuer des prédictions : Une fois le modèle de régression logistique entraîné et les résultats validés, il peut prédire la probabilité d’un résultat binaire pour de nouvelles données inconnues. À ce stade, les modèles sont généralement déployés pour effectuer des prédictions en temps réel dans des environnements de production, puis sérialisés et enregistrés en vue d’une utilisation ultérieure.

Huit alternatives à la régression logistique

La régression logistique n’est pas le seul modèle statistique utilisable pour effectuer des prédictions. Voici huit des alternatives les plus populaires :

  • Régression linéaire : Pour prédire une valeur continue, une simple régression linéaire utilisant une droite peut être plus appropriée pour estimer la relation entre une variable prédictive indépendante et une variable de résultat dépendante.
  • Régression polynomiale : La régression polynomiale peut estimer la relation entre un prédicteur et une variable de résultat en utilisant le polynôme de degré n de la variable prédictive pour modéliser des relations plus complexes entre les variables.
  • Régression ridge : La régression ridge est une technique statistique de régularisation qui corrige le surapprentissage des données d’entraînement en minimisant la somme des différences au carré entre les valeurs observées et prédites.
  • Régression Lasso : La régression Lasso, ou régularisation L1, est une autre technique statistique de régularisation qui corrige le surapprentissage en appliquant une pénalité pour améliorer la précision du modèle.
  • Régression Elastic Net : La régression linéaire Elastic Net combine les techniques Lasso et ridge pour régulariser les modèles de régression et améliorer leur précision. Elle est particulièrement efficace pour gérer la multicolinéarité et le surapprentissage.
  • Régression par arbres de décision : La régression par arbre de décision utilise un modèle arborescent pour prédire des valeurs numériques continues. Elle est idéale plutôt que la régression logistique lorsque les résultats catégoriels ne sont pas nécessaires, que les jeux de données sont volumineux et que les relations entre les caractéristiques et la variable cible sont complexes et non linéaires.
  • Régression par forêt aléatoire : La régression par forêt aléatoire combine plusieurs arbres de décision pour créer un modèle prédictif unique. Dans une forêt aléatoire, chaque « arbre » effectue ses propres prédictions à partir d’un sous-ensemble différent de données, puis les prédictions finales sont produites à partir de la moyenne ou de la moyenne pondérée des prédictions de l’ensemble des arbres.
  • Machine à vecteurs de support : La machine à vecteurs de support (SVM ) est un algorithme idéal pour apprendre des fonctions complexes et non linéaires. La SVM crée un hyperplan, ou une ligne/frontière de décision, qui sépare les données en classes. Elle est largement utilisée pour les problèmes de classification composée, de classement et de régression.

Logiciels populaires pour la régression logistique

Bien que de nombreux outils puissent aider à effectuer une régression logistique et d’autres analyses statistiques, RStudio, JMP et Minitab se distinguent.

R avec RStudio

R et RStudio forment une combinaison puissante pour exécuter une régression logistique et d’autres modèles statistiques sur un ordinateur de bureau. RStudio s’intègre à l’application/au langage R en tant qu’environnement de développement intégré (IDE), en réunissant un éditeur de code source, un débogueur et divers outils d’automatisation de compilation. Les tarifs varient selon l’application du client, avec une version académique gratuite d’un côté et une version entreprise à 14 995 dollars US de l’autre.

Posit icon.

JMP Statistical Discovery

Le logiciel statistique de JMP associe visualisation interactive et statistiques puissantes pour créer des modèles prédictifs adaptés à un large éventail de cas d’usage industriels et d’applications de recherche, notamment dans les secteurs de la chimie, de la pharmacie, des produits de consommation et des semi-conducteurs, entre autres. JMP propose une version gratuite. La version payante coûte 1 250 dollars US par an.

JMP icon.

Minitab

Minitab’s Statistical Software est une plateforme d’analyse de premier plan qui permet d’examiner les données pour découvrir des tendances, identifier et prédire des schémas, mettre au jour des relations cachées entre les variables et créer de puissantes visualisations. Elle est largement utilisée dans différents domaines, notamment l’enseignement supérieur, la recherche et l’industrie, et offre un vaste éventail de fonctionnalités. Minitab est disponible pour les systèmes d’exploitation Windows et Mac et propose différentes options de licence, notamment des licences perpétuelles, des abonnements et des remises universitaires.

Minitab icon.

Foire aux questions (FAQ)

Qu’est-ce que la régression logistique ?

La régression logistique est une technique statistique qui permet de déterminer la relation entre deux facteurs de données et d’effectuer une prédiction binaire.

Quelle est la différence entre la régression logistique et la régression linéaire classique ?

La régression logistique effectue des prédictions catégorielles (vrai/faux, 0 ou 1, oui/non), tandis que la régression linéaire classique prédit des résultats continus (poids, prix d’un logement).

Où la régression logistique est-elle utilisée ?

La régression logistique est utilisée dans pratiquement tous les secteurs, notamment les entreprises commerciales, le milieu universitaire, les administrations publiques et les organisations à but non lucratif. Par exemple, les organisations à but non lucratif utilisent souvent la régression logistique pour prédire les catégories de donateurs et de non-donateurs.

Quel est le secteur d’activité qui utilise le plus la régression logistique ?

La détection des fraudes, la prédiction de l’attrition des clients et l’évaluation de la solvabilité sont quelques cas d’usage courants de la régression logistique en entreprise.

Comment la régression logistique est-elle utilisée en IA/ML ?

La régression logistique est utilisée dans les tâches de classification en apprentissage automatique qui prédisent la probabilité qu’une instance appartienne à une classe donnée.

En résumé : maîtriser la régression logistique

De nombreux professionnels des données considèrent la régression logistique comme leur méthode statistique de prédilection, et à juste titre : c’est un outil puissant pour modéliser des résultats binaires, avec des applications dans des domaines aussi variés que la médecine, la finance et le marketing. Maîtriser la régression logistique vous donne un outil précieux pour l’évaluation des risques, le diagnostic et la prise de décision, ce qui en fait un élément essentiel de la boîte à outils de tout professionnel des données.

Découvrez notre liste des principales entreprises d’IA qui façonnent le secteur pour en savoir plus sur les outils, applications et plateformes à la pointe de cette technologie en pleine évolution.

Leon Yen

Leon Yen has been reporting on technology for over a decade and has written for CNET and BigThink. Before that, he was the co-founder and CEO of a cybersecurity startup, where he led the development of an industry-first cyber risk management platform. He has an MBA from the University of North Carolina, Charlotte and a BS in Information Systems from the University of San Francisco. In his spare time, he enjoys writing science fiction, surfing, and painting murals.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.