Was ist lineare Regression? Ein umfassender Leitfaden

Linear regression line on a retro graphical calculator.

Image: Tomasz/Adobe Stock

Written By
Leon Yen
Leon Yen
Nov 19, 2024
9 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Die lineare Regression ist möglicherweise der grundlegendste und zugänglichste Algorithmus des maschinellen Lernens (ML), zugleich aber auch einer der schnellsten und leistungsfähigsten. Daher greifen Fachleute in Wirtschaft, Wissenschaft und Forschung häufig auf diese weit verbreitete Methode für prädiktive Analysen zurück. Wenn Sie verstehen, wie die lineare Regression funktioniert, welche Typen und Merkmale sie hat, welche wesentlichen Vorteile sie bietet und in welchen Bereichen sie hauptsächlich eingesetzt wird, können Sie sie in Ihrem Unternehmen optimal nutzen.

DIE WICHTIGSTEN ERKENNTNISSE

  • Zu den drei Typen der linearen Regression gehören die einfache (einfache Variable), die multiple und die polynomiale Regression. (Zum Abschnitt springen)
  • Die lineare Regression wird in unterschiedlichsten Bereichen eingesetzt – von Wirtschaft und Ökonomie bis hin zum Gesundheitswesen und den Sozialwissenschaften. (Zum Abschnitt springen)
  • Für die häufigen Herausforderungen beim Einsatz linearer Regressionsmodelle stehen wirksame Methoden zur Verfügung. (Zum Abschnitt springen)

Was ist lineare Regression und wie funktioniert sie?

Auf der grundlegendsten Ebene verwendet die lineare Regression eine Variable – die unabhängige Variable –, um den Wert einer anderen Variable vorherzusagen: der abhängigen Variable. Diese unkomplizierte Formel für präzise Vorhersagen ermöglicht hochgradig erklärbare künstliche Intelligenz (XAI), die schnell trainiert werden kann.

Sie entstand aus der Entwicklung statistischer Methoden zur Analyse menschlicher Körpermaße, die der Naturforscher und Verhaltensgenetiker der viktorianischen Ära Sir Francis Galton maßgeblich vorantrieb. Bei der Untersuchung der Körpergrößen von Vätern und Söhnen stellte Galton fest, dass die Nachkommen im Vergleich zu ihren Eltern tendenziell weniger stark vom Mittelwert der Körpergröße der Bevölkerung abwichen – selbst wenn überdurchschnittlich große Väter typischerweise überdurchschnittlich große Söhne hatten.

Dieses statistische Phänomen – die „Regression zum Mittelwert“ – besagt, dass bei einem extremen Stichprobenwert einer Zufallsvariablen nachfolgende Stichproben derselben Zufallsvariablen nahe am Mittelwert der Grundgesamtheit liegen werden.

Advertisement

So funktioniert lineare Regression

Die lineare Regression beruht auf der Annahme, dass auf extreme Ergebnisse in zufälligen Datenstichproben wahrscheinlich normalere Datenpunkte folgen – und dass sich zwischen den aufgetragenen Datenpunkten eine gerade Linie legen lässt. Diese Linie kann als Referenz dienen, um Abweichungen zwischen vorhergesagten und tatsächlichen Ausgabewerten zu minimieren. Darüber hinaus lassen sich aus der Regressionsanalyse statistische Methoden ableiten, mit denen sich Beziehungen zwischen abhängigen Variablen und einer oder mehreren unabhängigen Variablen schätzen lassen.

Das Phänomen der Regression zum Mittelwert gilt praktisch für jedes messbare Merkmal von Eltern und Nachkommen. Statistiker erkennen darin eine mathematische Tatsache der natürlichen Variation bei wiederholten Daten und stützen sich auf diese Annahme, um unerwartete Abweichungen zwischen vorhergesagten und tatsächlichen Ausgabewerten zu minimieren.

A scatter plot showing linear regression

Unabhängige und abhängige Variablen in der linearen Regression

In der Regressionsanalyse ist die Ergebnisvariable die abhängige Variable, während die Störvariable als Prädiktor oder unabhängige Variable bezeichnet wird. Einfacher ausgedrückt: Die unabhängige Variable X ist die Ursache, und die abhängige Variable Y ist die Wirkung. Die beobachteten Daten aus Galtons Forschung schienen beispielsweise auf einen Zusammenhang zwischen zwei Variablen hinzudeuten – der Körpergröße eines Vaters und der Körpergröße seines Sohnes. Demnach wäre allgemein zu erwarten, dass die Körpergröße eines großen Vaters (X) zu einer großen Körpergröße seines Sohnes (Y) führt.

In einem Diagramm zur linearen Regression stellt die gerade Linie den bestmöglichen Versuch dar, die Quadratsumme der Residuen zwischen bekannten oder beobachteten Datenpunkten und den vorhergesagten Datenpunkten zu minimieren. Aus diesem Grund wird die Regressionslinie auch als Ausgleichsgerade bezeichnet, und das Verfahren zu ihrer Anpassung heißt Methode der kleinsten Quadrate.

Advertisement

Den Zusammenhang der Variablen verstehen

Die Regressionslinie zeigt an, wo die mittleren Datenpunkte voraussichtlich liegen. Indem Sie die Richtung der Linie und die Streuung der Datenpunkte um sie herum analysieren, können Sie Rückschlüsse auf den Zusammenhang zwischen den Variablen ziehen. Die folgende Abbildung zeigt die vier grundlegenden Szenarien, in denen eine kontinuierliche Variable auf der X-Achse und die andere auf der Y-Achse aufgetragen wird.

Szenario 1 zeigt eine starke positive Korrelation zwischen den Variablen X und Y, während Szenario 2 eine schwache positive Korrelation darstellt. In beiden Fällen verläuft die Regressionslinie von links nach rechts aufwärts. Galtons Beobachtungen sind ein Beispiel für eine positive Korrelation: Eine Zunahme der Körpergröße des Vaters steht mit einer Zunahme der Körpergröße des Sohnes in Zusammenhang. Szenario 3veranschaulicht, dass keine Korrelation zwischen den Variablen X und Y besteht. In diesem Fall verläuft die Regressionslinie horizontal. Szenario 4 zeigt eine starke negative Korrelation mit einer Regressionslinie, die von links nach rechts abwärts verläuft. So kann beispielsweise die Anzahl der Stunden, die jemand mit Sport verbringt, negativ mit dem Gewicht korrelieren, da mehr Bewegung zu Gewichtsverlust führen kann.

Four types of linear regression correlations

Koeffizienten schätzen und Werte vorhersagen

Die Gleichung y = mx +b stellt die grundlegendste Gleichung der linearen Regression dar:

  • x ist die Prädiktor- oder unabhängige Variable
  • y ist die abhängige Variable oder die zu bestimmende Variable
  • m ist die geschätzte Steigung der Regressionslinie
  • b ist der geschätzte Achsenabschnitt, an dem die Regressionslinie die y-Achse schneidet, wenn x auf 0 gesetzt wird

In dieser grundlegenden Gleichung der linearen Regression würde die Bestimmung von mIhnen die Änderungsrate zwischen x und y verratenm ist als wichtigster Regressionskoeffizient oder unbekannter Parameter definiert, der die Beziehung zwischen x und . y beschreibtMit anderen Worten: Wenn Sie den Wert von m kennen, können Sie den Wert von y anhand eines bekannten

Advertisement

x

-Werts vorhersagen.

  • Vier Typen der linearen RegressionDie vier häufigsten Typen der linearen Regression sind die einfache, die multiple und die polynomiale Regression. Wenn Sie ihre Unterschiede verstehen, können Sie feststellen, welcher Ansatz am besten zu Ihren Anforderungen passt:
  • Einfache lineare Regression: Das grundlegendste lineare Regressionsmodell beschreibt die Korrelation zwischen einer unabhängigen und einer abhängigen Variable. Dazu wird eine Regressionslinie verwendet, die die lineare Beziehung zwischen den beiden Variablen veranschaulicht.
  • Multiple lineare Regression: Die multiple lineare Regression beschreibt die Korrelation zwischen zwei oder mehr unabhängigen Variablen und einer abhängigen Variable, ebenfalls mithilfe einer geraden Regressionslinie.
  • Polynomiale Regression und andere Varianten: Die polynomiale Regression stellt die Beziehung zwischen den abhängigen und unabhängigen Variablen als Polynom n-ten Grades dar, beispielsweise ax². In dieser Form ist die Regressionslinie gekrümmt und nicht gerade.

Four types of scatter plots showing linear regression

Logistische Regression:

Die logistische Regression verwendet die unabhängigen Variablen, um die Wahrscheinlichkeit des Eintretens eines Ereignisses zu schätzen (entweder 0 oder 1). Anstatt eine kontinuierliche Größe oder Zahl vorherzusagen, ordnet diese Art der Regressionsanalyse Eingabedaten vordefinierten Gruppen oder Klassen zu. Wie der Name bereits andeutet, verwendet die logistische Regression logarithmische Funktionen zur Berechnung der Regressionslinie.

Wichtige Annahmen und Einschränkungen der linearen Regression

Die lineare Regression beruht auf mehreren Annahmen, die als Orientierung für ihre Leistungsfähigkeit dienen. In vielen Fällen lassen sich Verletzungen der Modellannahmen leicht erkennen, indem verschiedene Diagramme erstellt und visuell überprüft werden. So können Sie beispielsweise die Linearität anhand des Regressionsdiagramms prüfen: Wenn eine Kurve erkennbar ist, ist die Beziehung zwischen den Variablen möglicherweise nicht linear. Auch Ausreißer im Datensatz lassen sich bei kleinen Datensätzen einfach durch einen Blick auf das entsprechende Diagramm erkennen.

Advertisement

Andere Verletzungen von Modellannahmen erfordern möglicherweise eine eingehendere visuelle Analyse oder andere Diagrammtypen. Um beispielsweise auf Homoskedastizität zu prüfen, können Sie Residuen gegen angepasste Werte auftragen. Wenn sich die Residuen fächerförmig nach außen oder innen auffächern und dabei eine zunehmende oder abnehmende Streuung zeigen, ist der Datensatz wahrscheinlich nicht homoskedastisch.

Linearität und Unabhängigkeit der Beobachtungen

Die lineare Regression setzt voraus, dass eine lineare Beziehung zwischen den unabhängigen und abhängigen Variablen besteht. Datenexperten treffen diese Einschätzung typischerweise mithilfe eines Streudiagramms – einer beliebigen Sammlung von x- und y-Datenpunkten –, um zu prüfen, ob die Daten entlang einer geraden Linie liegen.

Homoskedastizität und Normalverteilung der Residuen

Die lineare Regression setzt außerdem voraus, dass die Varianzen der verglichenen Gruppen gleich oder ähnlich sind. Dies ist entscheidend, um die Genauigkeit der Regressionsanalysen sicherzustellen. Zur Messung der Vorhersagegenauigkeit verwenden Datenexperten die Normalverteilung der Residuen. Das bedeutet, sie messen die Differenz zwischen den beobachteten Daten und dem vorhergesagten Wert, um sicherzustellen, dass diese Differenzen normalverteilt sind.

Fehlende Multikollinearität

Multikollinearität bezeichnet eine problematische Situation, in der die unabhängigen Variablen eines Regressionsmodells miteinander korreliert sind. Wenn die unabhängigen Variablen einer linearen Regression stark korreliert sind, kann dies zu Problemen bei der Modellanpassung und zu Vorhersagefehlern führen – im Wesentlichen steigt der Standardfehler der Koeffizienten.

Nichtlineare Beziehungen

Die logistische Regression wurde zuvor als Möglichkeit zur Vorhersage der Klassenzugehörigkeit vorgestellt. Dafür müssen Modelle so angepasst werden, dass sie die Krümmung in den Datensätzen erfassen. Logarithmische, Quadratwurzel- oder Kehrwerttransformationen der unabhängigen und/oder abhängigen Variablen verändern die Vorhersage effektiv von kontinuierlichen zu diskreten Werten.

Advertisement

Ausreißer und Anomalien

Jeder ausreichend große Datensatz enthält zwangsläufig Ausreißer und Anomalien. Auch wenn der erste Impuls darin besteht, sie zu entfernen, sollten Sie sie nicht einfach verwerfen, sofern sie nicht auf einen Fehler zurückzuführen sind. Ihre Entfernung kann unnötige Verzerrungen in Ihre Datenwissenschaft einführen und Ihre Vorhersagen ungenauer machen. Stattdessen können Sie Ausreißer mit Methoden wie der quantilbasierten Begrenzung behandeln. Dabei werden Ausreißer auf einen bestimmten Wert oberhalb des 90. Perzentilwerts begrenzt oder auf einen Faktor unterhalb des 10. Perzentilwerts abgesenkt. Eine weitere Möglichkeit ist die Imputation durch Mittelwert oder Median, bei der die Ausreißer durch den Medianwert ersetzt werden.

  • Anwendungen der linearen Regression in verschiedenen BereichenUnternehmen aus vielen Branchen nutzen die lineare Regression für eine breite Palette von Anwendungen. Hier sind einige der häufigsten:
  • Umsatz- und Markttrends vorhersagen: Prognosen in Wirtschaft und Ökonomie umfassen den Einsatz linearer Regression, um abhängige und unabhängige Variablen zu analysieren und künftige Umsatzzahlen vorherzusagen.
  • Krankheitsmuster analysieren: Im Gesundheitswesen verwenden medizinische Fachkräfte die lineare Regression, um Beziehungen zwischen Patientenfaktoren und Krankheitsverläufen zu bestimmen und dadurch die Patientenversorgung und die klinische Praxis zu verbessern. So können Ärzte beispielsweise die Dauer eines Krankenhausaufenthalts anhand klinischer Messwerte, Behandlungsdaten und demografischer Patientendaten vorhersagen.

Verhaltenstrends verstehen:

In den Sozialwissenschaften und im Bildungswesen wird die lineare Regression häufig eingesetzt, um Ursache-Wirkungs-Beziehungen in gesellschaftlichen und demografischen Gruppen, bei Lernenden und bei Medienkonsumenten zu verstehen. Forschende können beispielsweise lineare Regression verwenden, um Social-Media-Trends, Beziehungen zwischen verschiedenen Variablen und deren Auswirkungen auf das menschliche Verhalten zu analysieren – etwa den Zusammenhang zwischen der Anzahl der online verbrachten Stunden und der Arbeitszufriedenheit.Software für lineare RegressionDer Markt bietet zahlreiche Tools und

KI-gestützte Software

die Sie bei der Durchführung linearer Regressionsanalysen und der Visualisierung von Daten für ein leichteres Verständnis unterstützen können. Wir empfehlen Alteryx, IBM SPSS und SAS.

Alteryx icon.

Alteryx interface screenshot.
Alteryx Designer.

Alteryx ist eine beliebte KI-Analyseplattform, die Datenexperten nutzen, um schnell auf Daten zuzugreifen, sie zu bearbeiten, zu analysieren und auszugeben. Die Designer-Plattform des Unternehmens bietet ein Tool für lineare Regression, mit dem sich einfache Modelle zur Schätzung von Werten oder zur Bewertung von Beziehungen zwischen Variablen auf Grundlage ihrer linearen Korrelationen erstellen lassen. Die Designer Cloud-Plattform von Alteryx kostet ab 4.950 US-Dollar, während Designer Desktop ab 5.195 US-Dollar erhältlich ist.

Alteryx besuchen

Alteryx Designer.

IBM icon.

IBM SPSS Statistics interface screenshot.
IBM SPSS Statistics.

IBM SPSS ist unter Datenexperten seit Langem beliebt, wenn es um statistische Analysen und multivariate statistische Verfahren wie die lineare Regression geht. Das Softwarepaket SPSS Statistics ermöglicht Anwendern aller Erfahrungsstufen die Durchführung fortgeschrittener statistischer Analysen. Die Preise hängen von den Funktionen und der Nutzerzahl ab, doch das Basisabonnement beginnt bei 1.069 US-Dollar pro Jahr für einen Nutzer.

IBM SPSS besuchen

IBM SPSS Statistics.

SAS icon.

A regression plot in SAS.
A regression plot in SAS.

Neben IBM SPSS ist SAS ein weiterer etablierter Marktführer in den Bereichen statistische Analyse und Datenanalyse. Das SAS-System bietet zahlreiche Regressionsverfahren, darunter REG für Regressionen zu allgemeinen Zwecken. Das Unternehmen veröffentlicht keine Preise, doch die gemeldeten Preisspannen variieren je nach Funktionen, Nutzerzahl und Add-ons erheblich.

SAS besuchen

Ein Regressionsdiagramm in SAS.

Häufige Herausforderungen und Lösungen bei der linearen Regression

Die lineare Regression ist ein komplexer Prozess, der viele positive Ergebnisse liefern kann, für diejenigen, die ihn implementieren möchten, aber auch Herausforderungen mit sich bringen kann. Hier ein Überblick über die häufigsten Herausforderungen und einige Lösungen.

Überanpassung und Unteranpassung bewältigen

Eine Überanpassung tritt auf, wenn ein Modell aufgrund überflüssiger Parameter zu komplex ist und die Stichprobengröße für aussagekräftige Vorhersagen zu klein ist. Dies führt zu ML-Modellen, die sich nicht gut auf neue Daten verallgemeinern lassen. Die einfachste Möglichkeit, einer Überanpassung entgegenzuwirken, besteht darin, mehr Daten zu erfassen und so die Modellgenauigkeit zu verbessern. Eine Unteranpassung tritt dagegen auf, wenn das ML-Modell nicht komplex genug ist und Beziehungen sowie Muster in den Daten nicht erkennen kann. In diesen Fällen können Sie die Modellkomplexität erhöhen, indem Sie die Anzahl der Merkmale im Datensatz steigern.Statistische Methoden kombinierenBei einigen Anwendungsfällen der Datenanalyse müssen Sie sowohl eine kontinuierliche Größe oder Zahl als auch eine diskrete Klassenzugehörigkeit vorhersagen. In solchen Szenarien besteht ein gängiger Ansatz darin, sowohl ein lineares Regressionsmodell als auch ein logistisches Klassifikationsmodell mit demselben Datensatz zu entwickeln und sie nacheinander einzusetzen. Alternativ könnten Sie ein Modell mit mehreren Ausgaben entwickeln – ein einzelnes

neuronales Netzwerkmodell

zur Vorhersage sowohl einer kontinuierlichen Größe als auch eines klassenbasierten Labelwerts aus derselben Eingabe.

Prädiktive Modelle verbessern

Wie bei allen Prognosemodellen sollten Ihre linearen Regressionsmodelle kontinuierlich bewertet und angepasst werden, damit Ihre Vorhersagen zuverlässig bleiben. Die Leistung und Effektivität Ihres Regressionsmodells können Sie anhand verschiedener quantitativer Messgrößen und Bewertungsmetriken beurteilen. Mithilfe von Bewertungsmetriken wie dem mittleren absoluten Fehler (MAE), dem mittleren quadratischen Fehler (MSE), der Wurzel des mittleren quadratischen Fehlers (RMSE), dem mittleren absoluten prozentualen Fehler (MAPE) und dem symmetrischen mittleren absoluten prozentualen Fehler (SMAPE) können Sie die numerische Abweichung zwischen Ihren tatsächlichen und vorhergesagten Werten effektiv messen.

Fazit: Entfesseln Sie die Macht der linearen Regression

Die lineare Regression ist ein unkomplizierter, zuverlässiger Ansatz für prädiktive Analysen und bildet nach wie vor eine Grundlage der modernen Datenwissenschaft sowie von KI/ML. Trotz der Vielzahl leistungsfähiger ML-Entwicklungen und -Techniken der letzten Jahre setzen Datenexpertinnen und Datenexperten bei der Erstellung von Vorhersagen zunehmend auf diese einfache und bewährte Methode.

Erfahren Sie mehr über große Sprachmodelle, die künstliche Intelligenz vorantreiben in unserem Leitfaden zu LLMs.

Leon Yen

Leon Yen has been reporting on technology for over a decade and has written for CNET and BigThink. Before that, he was the co-founder and CEO of a cybersecurity startup, where he led the development of an industry-first cyber risk management platform. He has an MBA from the University of North Carolina, Charlotte and a BS in Information Systems from the University of San Francisco. In his spare time, he enjoys writing science fiction, surfing, and painting murals.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.