Synthetische Daten verstehen: Vorteile und Anwendungen

Futuristic digital art illustration of data background.

Image: Artistic Visions/Adobe Stock

Written By
Shelby Hiter
Shelby Hiter
Jan 22, 2024
10 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Synthetische Daten sind eine Datenart, die mithilfe künstlicher Intelligenz generiert wird, um den Aufbau und die Eigenschaften realer oder ursprünglicher Daten möglichst genau nachzuahmen. Sie können in unterschiedlichsten Szenarien der Geschäftsdatenanalyse, Cybersicherheit und Produktentwicklung eingesetzt werden, doch in jedem Fall bieten synthetische Daten zahlreiche Vorteile für Datenschutz, Sicherheit und Zugänglichkeit.

In diesem Leitfaden gehen wir näher auf die Definition und gängige Anwendungsfälle synthetischer Daten ein und betrachten zugleich die wichtigsten Vorteile und möglichen Nachteile ihres Einsatzes. Außerdem stellen wir einige der frühen Wegbereiter und führenden Unternehmen im Bereich synthetischer Daten vor, um ein besseres Verständnis dafür zu vermitteln, in welche Richtung sich dieser Anwendungsfall von Enterprise-KI entwickelt.

Synthetische Daten verstehen

Synthetische Daten sind keine realen Daten und werden in vielen Fällen nicht direkt anhand eines bestimmten realen Datensatzes oder einer konkreten Beobachtung modelliert. Stattdessen handelt es sich um KI-generierte Daten, die für Simulationen auf Datensynthese, KI-Datenmodellierung und Stichprobenverfahren sowie auf komplexen Trainingsdaten beruhen, um wie herkömmliche Daten auszusehen, sich so zu verhalten und entsprechend zu reagieren.

Synthetische Daten werden häufig mithilfe von generativen KI-Modellen wie generativen adversarialen Netzwerken (GANs) und Variational Autoencoders (VAEs) erstellt. Sie können jedoch auch durch andere Datenmodellierungs- und Stichprobenstrategien erzeugt werden. Dazu gehören konventionellere statistische Modelle, Stichproben und Interpolation räumlicher Daten oder Zeitreihendaten sowie abhängigkeitsspezifische Strategien wie die Copula-Modellierung.

Das Ziel besteht darin, dass synthetische Daten wie reale Daten aussehen und sich entsprechend verhalten. In vielen Fällen wird dieses Ziel erreicht, insbesondere bei fortschrittlichen Modellierungstechniken und umfangreichen Qualitätstests, sodass sich synthetische und reale Daten nur schwer voneinander unterscheiden lassen.

Bei komplexeren, dynamischen und vielfältigeren Datenbeständen und Umgebungen sowie bei unerwarteten Ausreißern wird es jedoch schwieriger, mit synthetischen Daten jede einzelne Variable und Veränderung, die in realen Daten auftritt, präzise abzubilden.

Advertisement

Image of Synthesis AI's Job Builder tool, a subset of its Synthesis Humans product.
Synthesis AI’s Job Builder tool, a subset of its Synthesis Humans product, not only helps users generate the synthetic data to create human avatars but also helps them to reduce bias in their data outcomes. Source: Synthesis AI.

Das Tool Job Builder von Synthesis AI, ein Bestandteil des Produkts Synthesis Humans, hilft Nutzern nicht nur dabei, synthetische Daten zur Erstellung menschlicher Avatare zu generieren, sondern auch, Verzerrungen in ihren Datenergebnissen zu reduzieren. Quelle: Synthesis AI.

Eine maßgebliche Liste von Lösungen für synthetische Daten finden Sie in unserem Leitfaden: 9 Best Synthetic Data Software

Vollständig vs. teilweise synthetische Daten

Wie die Bezeichnungen bereits nahelegen, handelt es sich bei vollständig synthetischen Daten um einen Datensatz, der ausschließlich aus künstlich generierten Daten besteht, während teilweise synthetische Daten reale Daten mit einigen Ergänzungen durch synthetische Daten enthalten. Teilweise synthetische Daten werden vor allem mithilfe verschiedener Imputationsverfahren generiert, darunter Mittelwert- und Regressionsimputation sowie eine Reihe spezialisierter Modellierungstechniken. Teilweise synthetische Daten ähneln hybriden synthetischen Daten am stärksten. Dabei handelt es sich um ein ausgewogenes Verhältnis aus realen und synthetischen Daten in einem Datensatz.

Je nachdem, welche Daten Ihnen zur Verfügung stehen und was Sie damit erreichen möchten, können vollständig oder teilweise synthetische Daten die beste Lösung für Ihr Unternehmen sein. Vollständig synthetische Daten eignen sich am besten für Datenschutz- und Regulierungssituationen, in denen die Nutzung realer Daten untersagt ist. Sie sind außerdem für Forschungs- und Entwicklungsprojekte geeignet, die neue Bereiche erschließen, in denen reale Daten möglicherweise noch nicht verfügbar oder leicht zugänglich sind.

Advertisement

Teilweise synthetische Daten eignen sich dagegen am besten für Datensätze, bei denen einige wichtige Punkte vertraulich bleiben müssen, oder für Datensätze, denen wesentliche Informationen fehlen und die ergänzt werden müssen.

Anwendungsfälle für synthetische Daten

Synthetische Daten können im Gesundheitswesen, im Finanz- und Bankwesen, bei der Produkt- und Softwareentwicklung sowie in vielen anderen Bereichen eingesetzt werden, die große Mengen hochwertiger und besonders sicherer Daten benötigen. Dies sind einige der heutigen Einsatzmöglichkeiten synthetischer Daten:

  • Forschung und Analyse im Gesundheitswesen: Für die Gesundheitsforschung müssen Analysten kreative Wege finden, auf Patienten- und Falldaten zuzugreifen, ohne das Vertrauen der Patienten zu verletzen oder gesetzliche Vorgaben zur Einhaltung regulatorischer Bestimmungen wie HIPAA zu brechen. Mit vollständig oder teilweise synthetischen Daten können Forscher reale Falldaten nachbilden, ohne die geschützten Gesundheitsinformationen (PHI) von Patienten jemals zu berühren oder unrechtmäßig für Projekte der Datenanalyse mit generativer KI offenzulegen.
  • Weitere Szenarien mit vertraulichen oder regulierten Daten: Synthetische Daten schützen Verbraucherdaten und die Privatsphäre in zahlreichen anderen Branchen, darunter Einzelhandel und E-Commerce, Finanzwesen, Versicherungen und Bankwesen. Unternehmen können ihre aktuelle Leistung genauer messen und künftige Ergebnisse prognostizieren, ohne die spezifischen demografischen Daten ihrer Kunden zu betrachten, was dazu beiträgt, das Vertrauen der Verbraucher zu erhalten.
  • Synthetische Computer Vision: Ob es um die Generierung humanoider KI-Avatare, realistischer Straßen- oder Fabrikpläne oder einer anderen computergestützten Umgebung geht: Synthetische Daten liefern Entwicklern die für die Erstellung komplexer Computer-Vision-Produkte erforderliche Datenmenge und -qualität, die reale Umgebungen und ihre Datenpunkte möglichst genau nachbilden.
  • Forschung und Entwicklung innovativer Produkte und Lösungen: Forschungs- und Entwicklungsteams verlassen sich häufig auf synthetische Daten, um die Leistung ihrer neuesten Innovationen zu trainieren, zu testen und zu verbessern. Dies ist besonders effektiv bei Technologien wie autonomen Fahrzeugen, Drohnen, Katastrophenschutzsystemen, Smart Cities und digitalen Zwillingen. Sie alle profitieren von synthetischen Daten, da tatsächliche Leistungsdaten entweder unsichtbar oder nur schwer zu erfassen und abzurufen sein können.
  • Entwicklung, Test und Validierung von ML-Modellen: Maschinelles Lernen und andere KI-Modelle benötigen für das anfängliche Training sowie laufende Tests und Validierungen riesige Mengen vielfältiger Daten. Wenn nicht genügend reale Daten verfügbar oder leicht zugänglich sind, können Teams künstliche Daten synthetisieren, um die Lücken zu schließen und Modelle schnell zu erstellen.
  • NLP und KI-generierte Audiodaten: Datensynthese ist ein wichtiger Bestandteil der Sprach- oder Audiosynthese. Auf Grundlage von Trainingsdaten – und möglicherweise einer Bibliothek echter menschlicher Stimmen oder relevanter Soundeffekte – können Tools zur Generierung synthetischer Daten glaubwürdige Audiodaten für Videos, Podcasts und andere Medien erzeugen.
  • Cybersicherheit: Synthetische Daten können verwendet werden, um KI-Cyberangriffe, Netzwerkumgebungen und andere Komponenten der Cybersicherheitslandschaft eines Unternehmens für Schulungen und Verbesserungen im Bereich Cybersicherheit zu simulieren. Darüber hinaus können synthetische Daten als Ersatz für die vertraulichsten Daten eines Unternehmens generiert werden, sodass diese bei Datenanalysen und anderen datengestützten Aufgaben weniger wahrscheinlich durch einen Sicherheitsverstoß offengelegt werden.

Wenn Sie mehr darüber erfahren möchten, wie generative KI in Unternehmen eingesetzt wird, lesen Sie unseren Leitfaden: 15 Generative AI Enterprise Use Cases

Vorteile der Nutzung synthetischer Daten

Unternehmen aller Art nutzen zunehmend synthetische Daten, um die Privatsphäre von Verbrauchern und Organisationen zu schützen, verschiedene Vorschriften einzuhalten und anspruchsvollere Forschungs- und Analyseergebnisse schneller und in größerem Umfang zu erzielen. Dies sind nur einige der Vorteile, die sich aus der Nutzung synthetischer Daten in organisatorischen Arbeitsabläufen und Projekten ergeben können.

Verbesserter Datenschutz und Compliance

In vielen Branchen gelten strenge Vorschriften dafür, wie demografische Kundendaten wie Gesundheitszustände, Datumsangaben und Namen verwendet werden dürfen. Wenn Unternehmen diese Daten nutzen, riskieren sie Bußgelder wegen Verstößen oder sogar Gefängnisstrafen. Verzichten sie jedoch vollständig auf diese Daten, können sie möglicherweise nicht die für künftiges Wachstum erforderlichen detaillierten Analysen durchführen.

Advertisement

Synthetische Daten helfen in diesem Bereich, indem sie regulierten Branchen die Nutzung anonymisierter Daten ermöglichen, die den tatsächlichen personenbezogenen Daten (PII) ähneln und für datengestützte Projekte eingesetzt werden können. Dies ist auch für Organisationen nützlich, die ihre sensibelsten Geschäftsdaten vor dem Zugriff des gesamten Unternehmens schützen, aus diesen Informationen aber dennoch wertvolle Erkenntnisse gewinnen möchten.

Ergänzungen für vorhandene Datensätze

Datenknappheit ist für viele Projekte ein großes Problem. Relevante Daten sind möglicherweise schwer zu finden oder zu erfassen, unerschwinglich teuer oder von so viel regulatorischem Aufwand betroffen, dass sich ihre Nutzung nicht lohnt.

In vielen Fällen sind Datensätze unvollständig und den Nutzern fehlen die erforderlichen Ressourcen, um die fehlenden Bestandteile zu finden. Tools zur Generierung synthetischer Daten lösen dieses Problem effektiv, indem sie ihre algorithmischen und statistischen Trainingsdaten nutzen, um Lücken schnell und kostengünstig zu schließen.

Zugängliche Testdaten 

Ob für ein bestehendes Produkt oder eine Neuentwicklung: Synthetische Daten werden häufig von Organisationen eingesetzt, die sichere, konforme und einfach zu verwendende Testdaten zur Hand benötigen. Synthetische Daten eignen sich besonders für Forschungs- und Entwicklungsanwendungsfälle, vor allem bei der Entwicklung neuer Technologien. Forscher können synthetische Daten generieren, die exakt ihren Anforderungen entsprechen, selbst wenn sie Produkte erforschen oder entwickeln, die auf komplexen oder nahezu unsichtbaren Daten basieren.

Mögliche Kosteneinsparungen

Da Sie nicht für den Zugriff Dritter auf reale Datenquellen bezahlen, sondern die benötigten Daten per Self-Service selbst generieren, sparen synthetische Daten Unternehmen bei der Datenerfassung häufig Zeit und Geld. Wenn Sie Ihre Prozesse sowie die ausgewählten Tools und Partner jedoch nicht bewusst steuern, kann die Generierung synthetischer Daten mit der Zeit trotzdem teuer werden.

Advertisement

Hochgradig skalierbare Datenerstellung

Tools zur Generierung synthetischer Daten sind darauf ausgelegt, Daten in großem Umfang zu synthetisieren. Sie können Daten nicht nur schnell und mit minimalem menschlichem Eingreifen erzeugen, sondern liefern häufig auch Datenlabels, Annotationen und andere organisatorische Elemente, die Daten für Aufgaben wie Datenmodellierung und Modelltraining besonders nützlich machen.

Synthetisch generierte Daten eignen sich daher hervorragend für den Umfang und die Vielfalt, die für die Entwicklung und Feinabstimmung von Machine-Learning-Modellen erforderlich sind.

Wenn Sie mehr über die gesamte Landschaft führender KI-Software erfahren möchten, lesen Sie unseren Leitfaden: Best Artificial Intelligence Software

Nachteile der Nutzung synthetischer Daten

Synthetische Daten können viele Projekte zwar einfacher, schneller und überschaubarer machen, bei mangelnder Sorgfalt und fehlendem Bewusstsein für ihre Schwächen aber auch zu Ungenauigkeiten, Verzerrungen und anderen Problemen führen.

Dies sind einige der wichtigsten Nachteile, die Sie beim Einsatz synthetischer Daten berücksichtigen sollten:

Eingeschränkte Transparenz

Die Algorithmen und Trainingsdaten, die in die Entwicklung von Tools zur Datensynthese einfließen, sind häufig nicht besonders transparent. Das liegt vor allem daran, dass es derzeit nur wenige Vorschriften gibt, die Transparenzstandards für KI durchsetzen. Dadurch kann es schwierig werden, Datenergebnisse zu bewerten oder zu validieren. Wenn sich Ihre synthetisch generierten Daten ohne Ihr Wissen als ungenau erweisen, ziehen Sie möglicherweise unwissentlich falsche oder sogar gefährliche Schlussfolgerungen über Ihre Produkte und Dienstleistungen.

Advertisement

Schwierigkeiten bei der Erfassung der Komplexität realer Daten

Reale Daten lassen sich nur schwer exakt nachahmen, insbesondere weil sich ihre Umgebung, die Daten selbst und zahlreiche andere Faktoren jederzeit ändern können, wodurch Ihre synthetischen Daten veraltet und ungenau werden. Die KI- und statistischen Modelle, die synthetische Daten erzeugen, verfügen nicht unbedingt über ein kontextuelles Verständnis davon, wie die realen Daten in die Welt eingebettet sind. Daher funktionieren die bei der Erstellung synthetischer Daten gezogenen Schlussfolgerungen möglicherweise nicht für alle Geschäftsanwendungsfälle, insbesondere wenn sich Daten im Laufe der Zeit verändern.

Potenzielle Verzerrungen in Trainingsdaten und Algorithmen

Wie jede andere KI-basierte Innovation sind synthetische Daten nur so gut wie die Trainingsdaten und Algorithmen , die in ihre Erstellung einfließen. Enthalten die Trainingsmethoden inhärente Verzerrungen oder falsche Annahmen, können ungenaue oder sogar anstößige synthetische Daten entstehen. Dies kann je nach Schweregrad der verzerrten Ergebnisse, etwa bei Deepfakes, zu einem beschädigten Ruf, verlorenen Kunden oder möglichen rechtlichen Problemen führen.

Mögliches Overfitting

Je nachdem, wie ein Modell zur Generierung synthetischer Daten trainiert wird, kann es beginnen, synthetische Daten zu stark an die verwendeten Trainingsdaten anzupassen. Anders ausgedrückt: Das Modell kann so gut darin sein, seine Trainingsdaten zu lesen und ihnen zu folgen, dass es auch jedes Rauschen in den Trainingsdaten berücksichtigt und gleichzeitig neue Variablen oder Datenszenarien außer Acht lässt, die bei der Generierung neuer Daten auftreten können.

Overfitting führt dazu, dass synthetische Daten zwar wie reale Daten aussehen, sich aber nicht ebenso effektiv verhalten – insbesondere in komplexen und ungewöhnlicheren Szenarien, die nicht „nach Lehrbuch“ funktionieren.

Die wichtigsten Unternehmen für synthetische Daten

Verschiedene Start-ups und etablierte Unternehmen drängen mit Produkten und Dienstleistungen für synthetische Daten auf den Markt. Im Folgenden finden Sie einige der wichtigsten Unternehmen für synthetische Daten für allgemeine und branchenspezifische Anforderungen an synthetische Daten:

Mostly.ai icon.

  • MOSTLY AI: Dieses Unternehmen bietet eine Plattform zur Generierung synthetischer Daten, die Datenanonymisierung sowie weitere Datenschutz- und Sicherheitsmaßnahmen unterstützt. Das Unternehmen arbeitet vor allem mit Organisationen aus den Bereichen Bankwesen, Versicherungen, Telekommunikation und Gesundheitswesen zusammen.

Syntho icon.

  • Syntho: Die Plattform zur Generierung synthetischer Daten von Syntho heißt Syntho Engine. Sie wurde für die Arbeit mit verschiedenen Datentypen entwickelt und lässt sich in mehrere Cloud-Plattformen von Drittanbietern sowie andere Tools integrieren. Sie wird am häufigsten im Gesundheitswesen, im Finanzwesen und in öffentlichen Organisationen eingesetzt.

GenRocket icon.

  • GenRocket: Dieses Unternehmen konzentriert sich auf die Generierung synthetischer Daten für Testszenarien, einschließlich der Testdatenautomatisierung und CI/CD-Workflows. Es wird nicht nur im Gesundheitswesen, in der Versicherungsbranche und im Finanzdienstleistungssektor eingesetzt, sondern auch von Unternehmen jeder Art, die nützliche Testdaten für KI-/ML-Training, ETL- und/oder Projekte zur digitalen Transformation benötigen.

Hazy icon.

  • Hazy: Hazy ist ein auf Unternehmen fokussiertes Datensyntheseunternehmen, das neue Daten generiert und vorhandene Daten für digitale Infrastrukturen, Business Intelligence sowie Fortschritte und Verbesserungen im Bereich KI optimiert. Das Unternehmen arbeitet vor allem mit Organisationen aus den Bereichen Finanzdienstleistungen, Telekommunikation, Staat und Forschung zusammen.

Synthesis AI icon.

  • Synthesis AI: Dieses Datensyntheseunternehmen konzentriert sich auf die Generierung von Daten für Computer-Vision-Aufgaben und -Initiativen. Seine Produkte dienen unter anderem der Generierung realistischer menschlicher Avatare und Arbeitsplatzszenarien sowie von Daten für die Sicherheit von Fahrern und Fußgängern.

Fazit: Nutzung synthetischer Daten

Synthetische Daten eignen sich für eine Vielzahl von Geschäftsprojekten und Anwendungsfällen, insbesondere in Branchen, in denen Datenschutz und die Einhaltung regulatorischer Vorgaben unverzichtbar sind. Sie sind anonymisiert, einfach zu generieren und abzurufen und vor allem so konzipiert, dass sie kostengünstig und skalierbar sind und in den meisten datengestützten Arbeitsabläufen effektiv funktionieren.

Doch so nützlich diese Datenart auch sein kann: Sie bietet nur dann Vorteile, wenn Ihre Organisation die potenziellen Risiken, Verzerrungen und Schwächen kennt, die mit künstlich generierten Daten einhergehen. Zusätzlich zu den üblichen Aufgaben Ihres Teams bei der Bereinigung, Aufbereitung und Modellierung von Daten für das Training von Machine-Learning-Modellen und ähnliche Projekte ist es wichtig, sämtliche Trainingsdaten und Prozesse, die in die Generierung synthetischer Daten einfließen, sorgfältig zu prüfen. Denn es ist entscheidend zu wissen, wie genau synthetisch generierte Daten die realen Daten nachahmen, die Sie normalerweise verwenden würden. Für bestmögliche Ergebnisse sollten Sie mit einem führenden Unternehmen für synthetische Daten zusammenarbeiten, dem Sie vertrauen und das transparent arbeitet und Ihre spezifischen Datenanforderungen kennt.

Wenn Sie sich ein vollständiges Bild der heutigen Anbieter von Lösungen für synthetische Daten machen möchten, lesen Sie unseren Leitfaden: 9 Best Synthetic Data Software

Shelby Hiter

Shelby Hiter is a writer for eWeek and several other B2B technology websites. Previously, she managed editorial strategy on TechRepublic, Webopedia, LinuxToday, and SoftwarePundit. Her work has appeared in online publications such as TechRepublic, project-management.com, Datamation, eSecurity Planet, Enterprise Networking Planet, CIO Insight, AllBusiness.com, and SiteProNews. Her current B2B tech passions include artificial intelligence, managed services, open-source software, and big data.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.