Die logistische Regression ist ein statistisches Verfahren, mit dem die Beziehung zwischen zwei Datenfaktoren bestimmt wird, um eine binäre Vorhersage zu treffen. In Unternehmen kann diese Kategorisierung viele Formen annehmen: von der Vorhersage, ob ein Kunde die Produkte eines Unternehmens weiterhin kauft, bis zur Entscheidung, ob ein Kredit auf Grundlage der Merkmale eines Kreditnehmers genehmigt werden soll. Die logistische Regression ist außerdem ein grundlegender Algorithmus im maschinellen Lernen und in der Statistik. Wenn Sie die wichtigsten Anwendungen und die Funktionsweise der logistischen Regression verstehen, kann dies Ihrer Organisation helfen, den Einsatz dieses leistungsstarken Verfahrens zu erlernen. Das müssen Sie wissen.
- DIE WICHTIGSTEN ERKENNTNISSE
- Was ist logistische Regression?
- Funktionsweise der logistischen Regression
- Drei Arten der logistischen Regression
- Anwendungen logistischer Regressionsmodelle
- Vorteile und Einschränkungen der logistischen Regression
- Bewertung logistischer Regressionsmodelle: Leistung und Genauigkeit beurteilen
- Schritte und Überlegungen zum Trainieren eines logistischen Regressionsmodells
- Acht Alternativen zur logistischen Regression
- Beliebte Software für die logistische Regression
- Häufig gestellte Fragen (FAQs)
- Fazit: Logistische Regression meistern
DIE WICHTIGSTEN ERKENNTNISSE
- •Die logistische Regression verwendet die Logit-Funktion, um Vorhersagen auf Wahrscheinlichkeiten abzubilden. (Zum Abschnitt springen)
- •Logistische Modelle kommen in praktisch allen Branchen zum Einsatz, unter anderem im Gesundheitswesen, im Finanzwesen und im Marketing. (Zum Abschnitt springen)
- •Schwachstellen der logistischen Regression, etwa Overfitting, lassen sich durch Verfahren wie Regularisierung abmildern. (Zum Abschnitt springen)
Was ist logistische Regression?
Die logistische Regression ist ein statistisches Verfahren, das mehrere unabhängige Variablen und eine einzelne binäre abhängige Variable verwendet, um die Wahrscheinlichkeit des Eintretens eines bestimmten Ereignisses zu schätzen. Da das vorhergesagte Ergebnis eine Wahrscheinlichkeit ist, kann die abhängige Variable entweder den Wert 0 oder 1 annehmen. Dies wird als Logit-Transformation bezeichnet. Die logistische Regression trifft daher eine Vorhersage für zwei mögliche Szenarien:
- Ein Ereignis tritt nicht ein (0)
- Ein Ereignis tritt ein (1)
Beispielsweise wird die logistische Regression häufig verwendet, um vorherzusagen, ob Kunden mit ihren Krediten in Zahlungsverzug geraten – als Maß für ihre Kreditwürdigkeit.
Funktionsweise der logistischen Regression
Die logistische Regression verwendet eine logistische Funktion mit einer Sigmoidkurve (S-förmig), um lineare Kombinationen von Vorhersagen auf ihre Wahrscheinlichkeiten abzubilden. Sigmoidfunktionen bilden jeden reellen Wert auf einen Wahrscheinlichkeitswert zwischen 0 und 1 ab. Wenn Sie die Komponenten und Konzepte hinter der logistischen Regression verstehen, können Sie auch ihre allgemeine Funktionsweise nachvollziehen.

Ein Vergleich logistischer Funktionen.
Abhängige und unabhängige Variablen
Modelle der logistischen Regression verfügen über eine abhängige Variable und mehrere unabhängige kategoriale oder kontinuierliche Prädiktorvariablen. Anders als bei standardmäßigen linearen Regressionsmodellen ist bei der logistischen Regression keine lineare Beziehung zwischen den unabhängigen und abhängigen Variablen erforderlich. Homoskedastizität – eine konstante Varianz der Fehlerterme über alle unabhängigen Variablen hinweg – ist nicht erforderlich. Je nach Art der logistischen Regression gelten jedoch weitere Anforderungen. Bei der binären logistischen Regression müssen abhängige Variablen binär sein, während die ordinale logistische Regression ordinale abhängige Variablen erfordert – also Variablen, die in natürlichen, geordneten Kategorien auftreten.
Log-Odds und die Logit-Funktion
Bei der logistischen Regression weist die Logit-Funktion einer Wahrscheinlichkeit eine Zahl zu. Im Fall eines binären logistischen Regressionsmodells ist die abhängige Variable daher der Logit von p, wobei p die Wahrscheinlichkeit bezeichnet, dass die abhängige Variable den Wert 1 annimmt. Log-Odds sind eine Möglichkeit, Odds – also die Wahrscheinlichkeit des Eintretens eines Ereignisses – logarithmisch darzustellen. Log-Odds sind schlicht der Logarithmus der Odds.
Maximum-Likelihood-Schätzung
Die Maximum-Likelihood-Schätzung (MLE) ist ein weit verbreitetes probabilistisches Verfahren zur Schätzung der Parameter eines logistischen Regressionsmodells. MLE wählt die Parameterwerte des Modells aus, die die Likelihood-Funktion maximieren – im Wesentlichen also die Parameter, die am besten zu den Daten passen.
Odds Ratio und Interpretation
Bei der logistischen Regression bezeichnet das Odds Ratio den konstanten Einfluss einer unabhängigen Prädiktorvariablen auf die Wahrscheinlichkeit, dass ein bestimmtes abhängiges Ergebnis eintritt. Ein Verhältnis von mehr als 1 weist auf einen positiven Zusammenhang oder höhere Chancen für das Ergebnis hin, während ein Verhältnis von weniger als 1 einen negativen Zusammenhang oder geringere Chancen bezeichnet.
Annahmen der logistischen Regression
Die logistische Regression beruht auf den folgenden grundlegenden Annahmen und Anforderungen:
- Die abhängige Variable muss bei der binären logistischen Regression binär und bei der ordinalen logistischen Regression ordinal sein.
- Die Beobachtungen müssen voneinander unabhängig sein und dürfen nicht aus wiederholten Messungen stammen.
- Die unabhängigen Variablen dürfen keine Multikollinearität aufweisen; zwei oder mehr unabhängige Variablen dürfen also nicht miteinander korreliert sein.
- Die unabhängigen Variablen müssen linear mit den Log-Odds der abhängigen Variable zusammenhängen.
- Das logistische Regressionsmodell wurde mit großen Stichproben erstellt.
Drei Arten der logistischen Regression
Die folgenden drei Arten der logistischen Regression werden besonders häufig verwendet:
- Binäre logistische Regression: Die binäre logistische Regression wird eingesetzt, wenn die abhängige Variable nur zwei Ergebnisse aufweist – in diesem Fall wird sie als dichotome Variable bezeichnet. Ein typisches Szenario für die binäre logistische Regression ist die Vorhersage eines positiven oder negativen Werts beziehungsweise einer Ja- oder Nein-Antwort.
- Multinomiale logistische Regression: Die multinomiale logistische Regression wird verwendet, wenn die abhängige Variable nominal ist und mehr als zwei Kategorien ohne Rangfolge oder Ordnung aufweist. Mit anderen Worten: Sie dient dazu vorherzusagen, welcher von mehr als zwei Kategorien die abhängige Variable angehört.
- Ordinale logistische Regression: Die ordinale logistische Regression wird für Vorhersagen verwendet, wenn drei oder mehr Kategorien mit einer natürlichen Reihenfolge existieren, die jedoch nicht unbedingt gleichmäßige Abstände aufweisen. Bei Rangordnungsaufgaben kommt die ordinale logistische Regression häufig zum Einsatz, etwa bei der Einstufung der Leistung eines Schülers als überdurchschnittlich, durchschnittlich oder unterdurchschnittlich.
Anwendungen logistischer Regressionsmodelle
Die meisten Anwendungsfälle der logistischen Regression betreffen die binäre logistische Regression, bei der bestimmt wird, ob ein Beispiel einer bestimmten Klasse angehört. Viele praktische Probleme erfordern eine einfache Ja-oder-Nein-Vorhersage. Die logistische Regression liefert hierfür schnelle und präzise Vorhersagen, die leichter zu interpretieren und rechnerisch effizient sind. Außerdem lassen sich binäre Ergebnisse häufig einfach messen und erfassen und sie entsprechen vielen binär ausgerichteten Zielen in Wirtschaft, Gesundheitswesen und Technologie.
Die logistische Regression findet in vielen Bereichen des Gesundheitswesens, des Finanzwesens und des Marketings Anwendung. Mithilfe logistischer Modelle mit unabhängigen Prädiktorvariablen wie Gewicht, Bewegungsgewohnheiten und Alter können Kardiologen beispielsweise die Wahrscheinlichkeit bestimmen, dass Patienten erstmals oder erneut einen Herzinfarkt erleiden. Logistische Regressionsmodelle werden im Finanzwesen außerdem häufig eingesetzt, um das Kreditrisiko von Privatpersonen und Organisationen zu bewerten, die Kredite beantragen. Marketingfachleute verwenden die logistische Regression, um das Kaufverhalten von Kunden anhand von Prädiktoren wie Alter, Standort, Einkommen und Bildungsniveau vorherzusagen.
Vorteile und Einschränkungen der logistischen Regression
Die logistische Regression ist aufgrund mehrerer entscheidender Vorteile in zahlreichen Bereichen und Disziplinen vielseitig einsetzbar. Besonders wichtig sind ihre einfache Anwendung und ihre Erklärbarkeit. Logistische Modelle lassen sich unkompliziert implementieren und interpretieren und in kurzer Zeit effizient trainieren. Sie können leicht für mehrere Klassen und probabilistische Modelle angepasst werden und anhand der Modellkoeffizienten zeigen, welche Merkmale am wichtigsten sind. Vorhersagemodelle der logistischen Regression neigen außerdem weniger zu Overfitting, also dazu, dass die Anzahl der Beobachtungen die Anzahl der Merkmale übersteigt.
Die logistische Regression hat jedoch auch einige Einschränkungen. Logistische Modelle basieren auf der Annahme einer Linearität zwischen den unabhängigen Variablen und den Log-Odds der abhängigen Variable. Diese Annahme kann die Modellleistung in stark nichtlinearen Szenarien beeinträchtigen. Overfitting kann ebenfalls auftreten, wenn die Anzahl der Merkmale die Anzahl der Beobachtungen übersteigt. Außerdem funktioniert die logistische Regression nur bei geringer oder fehlender Multikollinearität zwischen den unabhängigen Variablen.
Bewertung logistischer Regressionsmodelle: Leistung und Genauigkeit beurteilen
Datenexperten verwenden verschiedene statistische Methoden, um die Leistung und Genauigkeit logistischer Regressionsmodelle zu beurteilen. Diese Messgrößen werden häufig in künstliche Intelligenz/Plattformen für maschinelles Lernen (KI/ML) als Tools für erklärbare KI (XAI) integriert, um die Ergebnisse von ML-Algorithmen zu verstehen und das Vertrauen in ihre Vorhersagen zu stärken.
Konfusionsmatrizen
Trotz ihres Namens fasst eine Konfusionsmatrix die Leistung eines Klassifikationsmodells auf einfache Weise zusammen. Sie zeigt, welche Arten von Fehlern ein Modell macht – also, wo es Klassen möglicherweise „verwechselt“. Da die logistische Regression häufig bei binären oder multiklassenfähigen Klassifikationsaufgaben eingesetzt wird, schlüsselt die Konfusionsmatrix diese Vorhersagen in die Anzahl der richtig positiven (TP), richtig negativen (TN), falsch positiven (FP) und falsch negativen (FN) Ergebnisse auf.

Eine Konfusionsmatrix für ein Vorhersagemodell zur Krebs-Klassifikation.
Genauigkeit, Präzision und F1-Score
Datenexperten können die aus einer Konfusionsmatrix abgeleiteten Zahlen verwenden, um die Genauigkeit, den Recall und den F1-Score ihrer logistischen Regressionsmodelle zu berechnen.
- Genauigkeit: Genauigkeit oder Präzision wird berechnet, indem die Anzahl der korrekten Vorhersagen – richtig positive und richtig negative – durch die Gesamtzahl der Vorhersagen geteilt wird.
(TP + TN) / (TP + FP + TN + FN)
- Präzision: Diese auch als Recall, Sensitivität oder Rate der richtig positiven Ergebnisse bezeichnete Kennzahl misst den Anteil der tatsächlich positiven Ergebnisse. Sie wird berechnet, indem die Anzahl der richtig positiven Ergebnisse (TP) durch die Anzahl der richtig positiven und falsch positiven Ergebnisse geteilt wird.
TP / (TP + FP)
- F1-Score: Dieser Score liefert ein einzelnes, ausgewogenes Maß für Genauigkeit und Recall, indem er das harmonische Mittel beider Werte bildet.
2 * (precision + recall / precision * recall)
ROC-Kurve und AUC-Score
Die Receiver-Operating-Characteristic-Kurve (ROC-Kurve) und die Fläche unter der ROC-Kurve (AUC) stellen die Leistung eines Klassifikators der logistischen Regression dar, indem sie für bestimmte Klassifikationskriterien die Kompromissraten zwischen richtig positiven und falsch positiven Ergebnissen abbilden. Datenexperten können die ROC-Kurve eines Modells visuell analysieren und seinen AUC-Score berechnen, um Genauigkeit und Zuverlässigkeit zu beurteilen. Ein leistungsfähigeres Modell weist einen höheren AUC-Score auf.

Eine ROC-Kurve.
Schritte und Überlegungen zum Trainieren eines logistischen Regressionsmodells
Das Verfahren zum Trainieren eines logistischen Regressionsmodells ähnelt dem für andere ML-Vorhersagemodelle. Es umfasst die folgenden drei Hauptschritte:
- Datenvorbereitung: Erstellen Sie den gekennzeichneten Datensatz mit Eingabemerkmalen (unabhängigen Variablen) und Ausgabekennzeichnungen (abhängigen Variablen), bereiten Sie die Daten vor und teilen Sie sie in Trainings- und Testdaten auf.
- Initialisierung und Training des Modells: Bestimmen Sie anhand der Trainingsdaten die Koeffizienten oder Gewichtungen jedes Merkmals, die die Kostenfunktion minimieren, und minimieren Sie sie mithilfe des Gradientenabstiegs.
- Bewertung des Modells: Bewerten Sie anhand der Testdaten die Genauigkeit des Modells, indem Sie die zuvor beschriebenen Bewertungsmethoden anwenden, etwa Konfusionsmatrizen oder den Genauigkeits-/Präzisions-/F1-Score.
- Vorhersagen treffen: Sobald das logistische Regressionsmodell trainiert und die Ergebnisse validiert wurden, kann es die Wahrscheinlichkeit eines binären Ergebnisses für neue, bisher unbekannte Daten vorhersagen. In dieser Phase werden Modelle in der Regel bereitgestellt, um in Produktionsumgebungen Echtzeitvorhersagen zu treffen, und für die spätere Verwendung serialisiert und gespeichert.
Acht Alternativen zur logistischen Regression
Die logistische Regression ist nicht das einzige statistische Modell, das für Vorhersagen eingesetzt werden kann. Hier sind acht der beliebtesten Alternativen:
- Lineare Regression: Wenn ein kontinuierlicher Wert vorhergesagt werden soll, ist möglicherweise eine einfache lineare Regression mit einer geraden Linie besser geeignet, um die Beziehung zwischen einer unabhängigen Prädiktorvariablen und einer abhängigen Ergebnisvariablen zu schätzen.
- Polynomiale Regression: Mit der polynomialen Regression lässt sich die Beziehung zwischen einem Prädiktor und einer Ergebnisvariablen mithilfe des Polynoms n-ten Grades der Prädiktorvariablen für komplexere Variablenbeziehungen schätzen.
- Ridge-Regression: Die Ridge-Regression ist ein statistisches Regularisierungsverfahren, das Overfitting bei Trainingsdaten korrigiert, indem es die Summe der quadrierten Differenzen zwischen beobachteten und vorhergesagten Werten minimiert.
- Lasso-Regression: Die Lasso-Regression oder L1-Regularisierung ist ein weiteres statistisches Regularisierungsverfahren, das Overfitting durch Anwendung einer Strafe korrigiert, um die Modellgenauigkeit zu verbessern.
- Elastic-Net-Regression: Die lineare Elastic-Net-Regression kombiniert Lasso- und Ridge-Verfahren, um Regressionsmodelle für eine bessere Genauigkeit zu regularisieren, und eignet sich besonders gut für den Umgang mit Multikollinearität und Overfitting.
- Entscheidungsbaum-Regression: Die Entscheidungsbaum-Regression verwendet ein baumartiges Modell zur Vorhersage kontinuierlicher numerischer Werte und ist der logistischen Regression vorzuziehen, wenn keine kategorialen Ergebnisse erforderlich sind, die Datensätze groß sind und die Beziehungen zwischen Merkmalen und Zielvariablen komplex und nichtlinear sind.
- Random-Forest-Regression: Die Random-Forest-Regression führt mehrere Entscheidungsbäume zu einem einzigen Vorhersagemodell zusammen. In einem Random Forest erstellt jeder „Baum“ aus einer anderen Teilmenge der Daten eigene, einzigartige Vorhersagen. Die endgültigen Vorhersagen werden als Durchschnitt oder gewichteter Durchschnitt der Vorhersagen der kombinierten Bäume erstellt.
- Support Vector Machine: Die Support Vector Machine (SVM ) ist ein idealer Algorithmus zum Erlernen komplexer, nichtlinearer Funktionen. SVM erstellt eine Hyperebene oder eine Linie/Entscheidungsgrenze, die Daten in Klassen trennt, und wird häufig bei Problemen der Mehrfachklassifikation, Rangordnung und Regression eingesetzt.
Beliebte Software für die logistische Regression
Zwar können verschiedene Tools bei der Durchführung logistischer Regressionen und anderer statistischer Analysen helfen, doch RStudio, JMP und Minitab stechen besonders hervor.
R mit RStudio
R und RStudio sind eine leistungsstarke Kombination zur Ausführung logistischer Regressionen und anderer statistischer Modelle auf dem Desktop. RStudio ist als integrierte Entwicklungsumgebung (IDE) in die Anwendung beziehungsweise Sprache R integriert und vereint einen Quellcode-Editor, einen Debugger und verschiedene Tools zur Build-Automatisierung. Die Preise variieren je nach Kundenanwendung: Am einen Ende steht eine kostenlose akademische Version, am anderen eine Enterprise-Version für 14.995 US-Dollar.

JMP Statistical Discovery
Das Statistiksoftwarepaket von JMP kombiniert interaktive Visualisierungen mit leistungsstarken statistischen Funktionen zur Erstellung von Vorhersagemodellen für zahlreiche industrielle Anwendungsfälle und Forschungsanwendungen, unter anderem in der Chemie, Pharmazie, bei Konsumgütern und in der Halbleiterbranche. JMP bietet eine kostenlose Version an. Die kostenpflichtige Version kostet 1.250 US-Dollar pro Jahr.

Minitab
Minitab’s Statistical Software ist eine führende Analyseplattform zur Untersuchung von Daten, um Trends zu erkennen, Muster zu finden und vorherzusagen, verborgene Beziehungen zwischen Variablen aufzudecken und leistungsstarke Visualisierungen zu erstellen. Die Software wird in zahlreichen Bereichen eingesetzt, darunter Wissenschaft, Forschung und Industrie, und bietet eine große Bandbreite an Funktionen. Minitab ist für die Betriebssysteme Windows und Mac verfügbar und bietet verschiedene Lizenzoptionen, darunter unbefristete Lizenzen, Abonnements und akademische Rabatte.

Häufig gestellte Fragen (FAQs)
Was ist logistische Regression?
Die logistische Regression ist ein statistisches Verfahren zur Bestimmung der Beziehung zwischen zwei Datenfaktoren und zur Erstellung einer binären Vorhersage.
Was ist der Unterschied zwischen logistischer Regression und regulärer linearer Regression?
Die logistische Regression erstellt kategoriale Vorhersagen (wahr/falsch, 0 oder 1, Ja/Nein), während die reguläre lineare Regression kontinuierliche Ergebnisse (Gewicht, Hauspreis) vorhersagt.
Wo wird die logistische Regression eingesetzt?
Die logistische Regression wird in praktisch allen Branchen eingesetzt, darunter in kommerziellen Unternehmen, der Wissenschaft, im öffentlichen Sektor und bei gemeinnützigen Organisationen. So verwenden gemeinnützige Organisationen die logistische Regression beispielsweise häufig, um vorherzusagen, ob Personen zu den Spendern oder Nichtspendern gehören.
In welchem Geschäftsbereich wird die logistische Regression am häufigsten eingesetzt?
Betrugserkennung, Abwanderungsprognosen und die Ermittlung der Kreditwürdigkeit gehören zu den gängigen geschäftlichen Einsatzmöglichkeiten der logistischen Regression.
Wie wird die logistische Regression in KI/ML eingesetzt?
Die logistische Regression wird bei ML-Klassifizierungsaufgaben eingesetzt, bei denen die Wahrscheinlichkeit vorhergesagt wird, dass eine Instanz einer bestimmten Klasse angehört.
Fazit: Logistische Regression meistern
Viele Datenexperten betrachten die logistische Regression aus gutem Grund als ihre bevorzugte statistische Methode: Sie ist ein leistungsstarkes Werkzeug zur Modellierung binärer Ergebnisse und findet in unterschiedlichsten Bereichen wie Medizin, Finanzen und Marketing Anwendung. Wer die logistische Regression beherrscht, verfügt über ein unschätzbar wertvolles Werkzeug für Aufgaben der Risikobewertung, Diagnose und Entscheidungsfindung – und damit über einen unverzichtbaren Bestandteil des Werkzeugkastens jedes Datenexperten.
Entdecken Sie unsere Liste der führenden KI-Unternehmen der Branche, um mehr über die Tools, Apps und Plattformen an der Spitze dieser dynamischen Technologie zu erfahren.

