Datenmodellierung umfasst die Methoden zur Erstellung von Datendarstellungen für die Datenvisualisierung, wodurch Nutzer die übergreifenden Werte und Zusammenhänge, die das potenzielle zugrunde liegende Wertversprechen der Daten ausmachen, besser verstehen können.
Datenmodellierung wird verwendet, um die Datenanforderungen für Data Mining und Datenanalyse zu definieren und zu analysieren. Der Prozess der Datenmodellierung umfasst professionelle Datenmodellierer, die eng mit den Stakeholdern aus dem Unternehmen sowie mit potenziellen Nutzern eines Systems zusammenarbeiten.
In diesem Artikel geht es um das Datenmodell, die verschiedenen Arten von Datenmodellen, Datenmodellierungstechniken und Beispiele.
Siehe auch: Die besten Tools für Datenmodellierung
Was ist ein Datenmodell?
Ein Datenmodell ist eine visuelle Darstellung von Datenelementen und den Beziehungen zwischen ihnen. Es ist die grundlegende Methode, um Abstraktion in einem Informationssystem zu nutzen. Datenmodelle definieren die logische Struktur von Daten, ihre Verknüpfungen sowie die Verarbeitung und Speicherung der Daten in Informationssystemen.
Datenmodelle stellen die konzeptionellen Werkzeuge bereit, um das Modell eines Informationssystems auf der Datenabstraktionsebene zu beschreiben. Sie ermöglichen es Nutzern zu entscheiden, wie Daten in einer Organisation gespeichert, genutzt, aktualisiert, abgerufen und geteilt werden.
Datenmodelle können außerdem ein Abbild des fertigen Systems und seines Aussehens nach der Implementierung liefern. Sie unterstützen die Entwicklung effektiver Informationssysteme, indem sie die Definition und Strukturierung von Daten im Rahmen relevanter Geschäftsprozesse ermöglichen. Dadurch wird die Kommunikation geschäftlicher und technischer Anforderungen für die Entwicklung eines Aktionsplans erleichtert.
Frühere Datenmodelle konnten „flache Datenmodelle“ sein, bei denen Daten in derselben Ebene dargestellt wurden und daher eingeschränkt waren; flache Modelle konnten Duplikate und Anomalien verursachen. Heute sind Datenmodelle eher dreidimensional und für die Entwicklung von Geschäfts- und IT-Strategien äußerst effektiv und nützlich.
Siehe auch: Die besten Tools für Datenvisualisierung
Welche Arten von Datenmodellen gibt es?
Das ANSI/X3/SPARC Standards Planning and Requirements Committee beschrieb ein Drei-Schema-Konzept, das erstmals 1975 eingeführt wurde. Diese drei Arten von Datenmodellschemata sind das konzeptionelle, das logische und das physische Schema.
Siehe auch: Was ist Data Mining?
Konzeptionelles Schema
Ein konzeptionelles Datenmodell oder konzeptionelles Schema ist eine übergeordnete Beschreibung von Informationen, die bei der Entwicklung eines Informationssystems, etwa von Datenbankstrukturen, verwendet wird. Es ist eine Darstellung von Konzepten und den Beziehungen zwischen ihnen und umfasst typischerweise nur die wichtigsten Konzepte und Beziehungen.
Das konzeptionelle Schema beschreibt die Semantik einer Organisation und stellt eine Reihe von Aussagen dar. Es kann auf verschiedenen Abstraktionsebenen existieren und verbirgt die internen Details physischer Speicherstrukturen. Stattdessen konzentriert es sich auf die Beschreibung von Entitäten, Datentypen, Beziehungen und Einschränkungen. Der Entwurfsprozess für das konzeptionelle Schema nimmt die Informationsanforderungen einer Anwendung als Eingabe und erzeugt ein Schema, das in Form einer Notation für die konzeptionelle Modellierung ausgedrückt wird. Nachfolgend sehen Sie ein Beispiel für ein konzeptionelles Schema:

Logisches Schema
Ein logisches Datenmodell oder logisches Schema ist eine Darstellung der abstrakten Struktur des Informationsbereichs, die alle auf die gespeicherten Daten angewendeten logischen Einschränkungen definiert. Eine spezifische Problemdomäne beschreibt die Verwaltung oder Speicherung von Informationen unabhängig von der verwendeten Technologie des Informationssystems und definiert Sichten, Tabellen und Integritätsbedingungen. Ein logisches Schema definiert den Entwurf des Informationssystems auf seiner logischen Ebene.
Softwareentwickler und Administratoren arbeiten in der Regel auf dieser Ebene. Obwohl die Daten als Datensätze beschrieben werden können, die in Form von Datenstrukturen gespeichert sind, bleiben die Implementierung der Datenstruktur und andere interne Details auf dieser Ebene verborgen. Nachfolgend sehen Sie ein Beispiel für ein logisches Schema:

Physisches Schema
Ein physisches Datenmodell oder physisches Schema ist eine Darstellung eines Implementierungsentwurfs; es definiert die Datenabstraktion innerhalb physischer Parameter.
Ein vollständiges physisches Schema umfasst alle Artefakte des Informationssystems, die erforderlich sind, um Leistungsziele zu erreichen oder Beziehungen zwischen Daten herzustellen, etwa Indizes, Verknüpfungstabellen und Definitionen von Einschränkungen. Analysten können ein physisches Schema verwenden, um den Speicherbedarf zu berechnen; dies kann auch spezifische Details zur Speicherzuweisung für ein Informationssystem umfassen.

Siehe auch: Was ist Datenanalyse?
Welche Datenmodellierungstechniken gibt es?
Es gibt verschiedene Techniken, um Datenmodellierung erfolgreich umzusetzen, auch wenn die grundlegenden Konzepte bei allen Techniken gleich bleiben. Zu den verbreiteten Datenmodellierungstechniken gehören hierarchische, relationale, Netzwerk-, Entity-Relationship- und objektorientierte Verfahren.
Hierarchische Technik
Die hierarchische Datenmodellierung folgt einer baumartigen Struktur, in der die Knoten in einer bestimmten Reihenfolge angeordnet sind. Eine Hierarchie ist eine Anordnung von Elementen, die als „über“, „unter“ oder „auf derselben Ebene wie“ andere Elemente dargestellt werden. Die hierarchische Datenmodellierung wurde im IBM Information Management System (IMS) implementiert und 1966 eingeführt.
Sie war in vielen verschiedenen Bereichen verbreitet, darunter Informatik, Mathematik, Design, Architektur, Systembiologie, Philosophie und Sozialwissenschaften. Aufgrund der Schwierigkeiten beim Abrufen und Zugreifen auf Daten wird sie heute jedoch nur noch selten verwendet.
Relationale Technik
Die relationale Datenmodellierung wird verwendet, um verschiedene Beziehungen zwischen Entitäten zu beschreiben. Dadurch wird die Komplexität reduziert und ein klarer Überblick geschaffen. Das relationale Modell wurde 1969 erstmals vom IBM-Forscher Edgar F. Codd als Alternative zum hierarchischen Modell vorgeschlagen. Es kennt vier verschiedene Beziehungstypen zwischen Entitäten: eins zu eins, eins zu vielen, viele zu eins und viele zu vielen.
Netzwerktechnik
Die Netzwerk-Datenmodellierung ist eine flexible Möglichkeit, Objekte und die zugrunde liegenden Beziehungen zwischen Entitäten darzustellen. Dabei werden die Objekte innerhalb von Knoten dargestellt und die Beziehungen zwischen den Knoten als Kanten veranschaulicht. Sie wurde von der hierarchischen Technik inspiriert und 1969 ursprünglich von Charles Bachman eingeführt.
Die Netzwerk-Datenmodellierung erleichtert die Darstellung komplexer Beziehungen als Datensätze, die mit mehreren übergeordneten Datensätzen verknüpft werden können.
Entity-Relationship-Technik
Die Entity-Relationship-(ER-)Datenmodellierung stellt Entitäten und die Beziehungen zwischen ihnen in einem grafischen Format dar, das aus Entitäten, Attributen und Beziehungen besteht. Entitäten können alles Mögliche sein, etwa ein Objekt, ein Konzept oder ein Datenelement. Die Entity-Relationship-Datenmodellierung wurde für Datenbanken entwickelt und 1976 von Peter Chen eingeführt. Sie ist ein relationales Modell auf hoher Ebene, das zur Definition von Datenelementen und Beziehungen in einem anspruchsvollen Informationssystem verwendet wird.
Objektorientierte Technik
Die objektorientierte Datenmodellierung erstellt Objekte auf Grundlage realer Szenarien, die als Objekte dargestellt werden. Die objektorientierten Methoden wurden Anfang der 1990er-Jahre eingeführt und von einer großen Gruppe führender Datenwissenschaftler inspiriert.
Sie ist eine Sammlung von Objekten, die gespeicherte Werte enthalten, wobei es sich bei diesen Werten um nichts anderes als Objekte handelt. Die Objekte verfügen über ähnliche Funktionen und sind mit anderen Objekten verknüpft.

Datenmodellierung: Eine integrierte Sicht
Datenmodellierung ist eine wichtige Technologie, um Beziehungen zwischen Datensätzen zu verstehen. Die integrierte Sicht auf konzeptionelle, logische und physische Datenmodelle hilft Nutzern, die Informationen zu verstehen und sicherzustellen, dass im gesamten Unternehmen die richtigen Informationen verwendet werden.
Obwohl eine effektive Datenmodellierung Zeit in Anspruch nehmen kann, spart sie möglicherweise erhebliche Zeit und Kosten, indem sie Fehler erkennt, bevor diese auftreten. Manchmal kann eine kleine Änderung der Struktur eine Anpassung der gesamten Anwendung erforderlich machen.
Einige Informationssysteme, etwa Navigationssysteme, verwenden eine komplexe Anwendungsentwicklung und -verwaltung, die fortgeschrittene Kenntnisse in der Datenmodellierung erfordert. Für diesen Zweck der Datenmodellierung werden zahlreiche Open-Source-Lösungen für Computer-Aided Software Engineering (CASE) sowie kommerzielle Lösungen eingesetzt.
Siehe auch: Leitfaden zu Datenpipelines

