Comprendre les données synthétiques : avantages et applications

Futuristic digital art illustration of data background.

Image: Artistic Visions/Adobe Stock

Written By
Shelby Hiter
Shelby Hiter
Jan 22, 2024
12 minute read
eWeek content and product recommendations are editorially independent. We may make money when you click on links to our partners. Learn More

Les données synthétiques sont un type de données générées par l’intelligence artificielle afin d’imiter étroitement la structure et les capacités de données réelles ou originales. Elles peuvent être utilisées dans divers scénarios d’analyse de données métier, de cybersécurité et de développement de produits, mais dans tous les cas, elles offrent de nombreux avantages en matière de confidentialité, de sécurité et d’accessibilité des données.

Dans ce guide, nous approfondirons la définition et les cas d’usage courants des données synthétiques, tout en examinant leurs principaux avantages et les inconvénients potentiels de leur utilisation. Nous présenterons également certains des pionniers et leaders du secteur des données synthétiques afin de mieux comprendre la direction que prend ce cas d’usage de l’IA d’entreprise.

Comprendre les données synthétiques

Les données synthétiques ne sont pas des données du monde réel et, dans de nombreux cas, elles ne sont pas directement modélisées à partir d’un jeu de données ou d’une observation spécifique du monde réel. Il s’agit plutôt de données générées par l’IA qui reposent sur la synthèse de données, la modélisation des données par l’IA et l’échantillonnage à des fins de simulation, ainsi que sur des données d’entraînement complexes pour avoir l’apparence, le comportement et les réactions de données traditionnelles.

Les données synthétiques sont souvent créées à l’aide de modèles d’IA générative tels que les réseaux antagonistes génératifs (GAN) et les autoencodeurs variationnels (VAE), mais elles peuvent également être créées au moyen d’autres stratégies de modélisation et d’échantillonnage des données. Il peut s’agir de modèles statistiques plus conventionnels, de l’échantillonnage et de l’interpolation de données spatiales ou de séries temporelles, ou encore de stratégies fondées sur les dépendances, comme la modélisation par copules.

L’objectif est que les données synthétiques aient l’apparence et le comportement de données du monde réel. Dans de nombreux cas, notamment grâce à des techniques de modélisation avancées et à des tests de qualité approfondis, cet objectif est atteint et il est difficile de distinguer les données synthétiques des données réelles.

Cependant, lorsque les ensembles et environnements de données sont plus complexes, dynamiques et hétérogènes, et qu’ils comportent des valeurs aberrantes inattendues, il devient plus difficile pour les données synthétiques de reproduire fidèlement chaque variable et chaque évolution observées dans les données du monde réel.

Advertisement

Image of Synthesis AI's Job Builder tool, a subset of its Synthesis Humans product.
Synthesis AI’s Job Builder tool, a subset of its Synthesis Humans product, not only helps users generate the synthetic data to create human avatars but also helps them to reduce bias in their data outcomes. Source: Synthesis AI.

L’outil Job Builder de Synthesis AI, qui fait partie de son produit Synthesis Humans, aide non seulement les utilisateurs à générer les données synthétiques nécessaires à la création d’avatars humains, mais aussi à réduire les biais dans les résultats issus de leurs données. Source : Synthesis AI.

Pour consulter une liste de référence des solutions de données synthétiques, lisez notre guide : 9 meilleurs logiciels de données synthétiques

Données entièrement ou partiellement synthétiques

Comme leur nom l’indique, les données entièrement synthétiques constituent un jeu de données composé exclusivement de données générées artificiellement, tandis que les données partiellement synthétiques constituent un jeu de données qui associe des données réelles à quelques ajouts de données synthétiques. Les données partiellement synthétiques sont principalement générées au moyen de différentes méthodes d’imputation, notamment l’imputation par la moyenne et par régression, ainsi que de quelques techniques de modélisation spécialisées. Les données partiellement synthétiques sont très proches des données synthétiques hybrides, qui établissent un équilibre étroit entre données réelles et données synthétiques au sein d’un jeu de données.

Selon les données dont vous disposez et l’usage que vous souhaitez en faire, les données entièrement ou partiellement synthétiques peuvent constituer la meilleure solution pour votre organisation. Les données entièrement synthétiques sont particulièrement adaptées aux situations liées à la confidentialité et à la réglementation qui interdisent l’utilisation de toute donnée réelle. Elles conviennent également aux projets de recherche et développement qui innovent dans de nouveaux domaines où les données réelles ne sont pas encore disponibles ou facilement accessibles.

Advertisement

À l’inverse, les données partiellement synthétiques sont particulièrement adaptées aux jeux de données qui comportent quelques éléments clés devant rester confidentiels, ou aux jeux de données auxquels il manque des informations essentielles et qui doivent être complétés.

Cas d’usage des données synthétiques

Les données synthétiques peuvent être utilisées dans les secteurs de la santé, de la finance et de la banque, du développement de produits et de logiciels, ainsi que dans de nombreux autres domaines qui nécessitent de grandes quantités de données sécurisées et de haute qualité. Voici quelques-unes des façons dont les données synthétiques sont utilisées aujourd’hui :

  • Recherche et analyse dans le secteur de la santé : La recherche dans le secteur de la santé oblige les analystes à trouver des moyens créatifs d’accéder aux données relatives aux patients et aux cas sans trahir la confiance des patients ni enfreindre les réglementations, comme la loi HIPAA. Grâce à des données entièrement ou partiellement synthétiques, les chercheurs peuvent reproduire des données de cas réels sans jamais manipuler ni exposer illégalement les informations de santé protégées (PHI) des patients dans le cadre de projets d’analyse de données par IA générative.
  • Autres scénarios impliquant des données privées ou réglementées : Les données synthétiques protègent les données relatives à la vie privée des consommateurs dans de nombreux autres secteurs, notamment la vente au détail et le commerce électronique, la finance, l’assurance et la banque. Les entreprises peuvent mesurer plus précisément leurs performances actuelles et prévoir leurs résultats futurs sans examiner les données démographiques spécifiques de leurs clients, ce qui contribue à préserver la confiance des consommateurs.
  • Vision par ordinateur synthétique : Qu’il s’agisse de générer des avatars humanoïdes dotés d’IA, des plans réalistes de routes ou d’usines, ou tout autre type d’environnement informatisé, les données synthétiques fournissent aux développeurs la quantité et la qualité de données nécessaires à la création de produits complexes de vision par ordinateur qui reproduisent fidèlement les environnements réels et leurs points de données.
  • R&D pour des produits et solutions innovants : Les équipes de recherche et développement s’appuient souvent sur les données synthétiques pour entraîner, tester et améliorer les performances de leurs dernières innovations. Cette approche est particulièrement efficace pour des technologies comme les véhicules autonomes, les drones, les systèmes d’intervention en cas de catastrophe, les villes intelligentes et les jumeaux numériques, qui bénéficient tous des données synthétiques, car les données de performance réelles peuvent être invisibles, difficiles à collecter ou difficiles d’accès.
  • Développement, test et validation des modèles de ML : Les modèles d’apprentissage automatique et les autres modèles d’IA nécessitent d’énormes quantités de données diversifiées pour leur entraînement initial, ainsi que pour les tests et la validation continus. Lorsque suffisamment de données du monde réel ne sont pas disponibles ou facilement accessibles, les équipes peuvent synthétiser des données artificielles afin de combler les lacunes et de déployer rapidement des modèles.
  • TAL et audio généré par l’IA : La synthèse de données joue un rôle important dans la synthèse vocale ou audio. À partir de données d’entraînement — et éventuellement d’une bibliothèque de voix humaines réelles ou d’effets sonores pertinents — les outils de génération de données synthétiques peuvent produire un contenu audio crédible pour des vidéos, des podcasts et d’autres médias.
  • Cybersécurité : Les données synthétiques peuvent être utilisées pour simuler des attaques de cybersécurité par IA, des environnements réseau et d’autres composantes du dispositif de cybersécurité d’une entreprise à des fins de formation et d’amélioration dans ce domaine. En outre, des données synthétiques peuvent être générées pour remplacer les données les plus confidentielles d’une entreprise, réduisant ainsi le risque qu’elles soient compromises lors d’analyses de données et d’autres tâches fondées sur les données.

Pour en savoir plus sur l’utilisation de l’IA générative en entreprise, lisez notre guide : 15 cas d’usage de l’IA générative en entreprise

Avantages de l’utilisation des données synthétiques

Les entreprises de tous les secteurs utilisent de plus en plus les données synthétiques pour protéger la vie privée des consommateurs et des organisations, se conformer à diverses réglementations et obtenir plus rapidement, à plus grande échelle, des résultats de recherche et d’analyse plus sophistiqués. Il ne s’agit là que de quelques-uns des avantages que l’utilisation de données synthétiques peut apporter aux flux de travail et aux projets de votre organisation.

Une meilleure confidentialité des données et une conformité renforcée

Dans de nombreux secteurs, des réglementations strictes encadrent l’utilisation de données démographiques relatives aux clients, comme les informations de santé, les dates et les noms. Si les entreprises choisissent d’utiliser ces données, elles s’exposent à des amendes pour non-conformité, voire à des peines de prison ; mais si elles les évitent complètement, elles risquent de ne pas pouvoir réaliser les analyses approfondies nécessaires à leur croissance future.

Advertisement

Les données synthétiques apportent une réponse à ce problème en permettant aux secteurs réglementés d’utiliser, dans le cadre de leurs projets axés sur les données, des données anonymisées similaires à de véritables informations personnelles identifiables (PII). Cette approche est également utile aux organisations qui souhaitent empêcher l’accès de toute l’entreprise à leurs données métier les plus sensibles, tout en continuant à en tirer des informations exploitables.

Compléter les jeux de données existants

La pénurie de données constitue un problème majeur pour de nombreux projets. Les données pertinentes peuvent être difficiles à trouver ou à collecter, leur acquisition peut être prohibitive, ou elles peuvent être soumises à tant de contraintes réglementaires qu’il n’est pas intéressant de les utiliser.

Dans de nombreux cas, les jeux de données sont incomplets et les utilisateurs ne disposent pas des ressources nécessaires pour trouver les éléments manquants. Les outils de génération de données synthétiques résolvent efficacement ce problème en s’appuyant sur leur entraînement algorithmique et statistique pour combler rapidement les lacunes à moindre coût.

Des données de test accessibles 

Qu’il s’agisse d’un produit existant ou d’un nouveau développement, les organisations qui ont besoin de données de test sécurisées, conformes et faciles à utiliser à portée de main ont souvent recours aux données synthétiques. Celles-ci sont particulièrement efficaces pour les cas d’usage en R&D, notamment dans le développement de nouvelles technologies. Les chercheurs peuvent générer des données synthétiques qui répondent exactement à leurs exigences, même lorsqu’ils cherchent à étudier ou à développer des produits fondés sur des données complexes ou presque invisibles.

Des économies potentielles

Comme vous ne payez pas pour accéder à des sources de données réelles tierces et que vous générez vous-même exactement les données dont vous avez besoin, les données synthétiques permettent souvent aux organisations d’économiser du temps et de l’argent lors de la collecte de données. Toutefois, si vos processus et le choix de vos outils et partenaires ne sont pas réfléchis, la génération de données synthétiques peut tout de même devenir coûteuse au fil du temps.

Advertisement

Une création de données hautement évolutive

Les outils de génération de données synthétiques sont conçus pour synthétiser des données à très grande échelle. Non seulement ces outils peuvent générer rapidement des données avec une intervention humaine minimale, mais ils fournissent aussi souvent les libellés, annotations et autres éléments organisationnels qui rendent les données particulièrement utiles pour des tâches comme la modélisation des données et l’entraînement des modèles.

Les données générées synthétiquement sont donc idéales pour atteindre l’échelle et la diversité nécessaires au développement et à l’ajustement fin des modèles d’apprentissage automatique.

Pour découvrir l’univers plus vaste des principaux logiciels d’IA, lisez notre guide : Les meilleurs logiciels d’intelligence artificielle

Inconvénients de l’utilisation des données synthétiques

Si les données synthétiques peuvent simplifier, accélérer et faciliter la gestion de nombreux projets, elles peuvent également entraîner des inexactitudes, des biais et d’autres problèmes si vous ne les utilisez pas avec prudence et si vous ne tenez pas compte de leurs limites.

Voici quelques-uns des inconvénients les plus importants à garder à l’esprit lors de l’utilisation de données synthétiques :

Une transparence limitée

Les algorithmes et les données d’entraînement utilisés pour créer les outils de synthèse des données sont souvent loin d’être transparents, notamment parce qu’il existe actuellement peu de réglementations imposant des normes de transparence pour l’IA. Il peut donc être difficile d’évaluer ou de valider les résultats produits par les données. Et si les données générées synthétiquement s’avèrent inexactes à votre insu, vous risquez de tirer sans le savoir des conclusions erronées, voire dangereuses, sur vos produits et services.

Advertisement

La difficulté à reproduire les complexités des données du monde réel

Il est difficile d’imiter exactement les données du monde réel, notamment parce que leur environnement, les données elles-mêmes et bien d’autres facteurs peuvent changer à tout moment, rendant vos données synthétiques obsolètes et inexactes. Les modèles d’IA et les modèles statistiques qui génèrent les données synthétiques ne comprennent pas nécessairement le contexte dans lequel les données réelles s’inscrivent, ce qui signifie que les conclusions tirées lors de la création de données synthétiques peuvent ne pas s’appliquer à tous les cas d’usage métier, surtout lorsque les données évoluent au fil du temps.

Un risque de biais dans les données d’entraînement et les algorithmes

Comme pour toute autre innovation fondée sur l’IA, les données synthétiques ne valent que par les données d’entraînement et les algorithmes qui contribuent à leur création. Si les méthodes d’entraînement comportent des biais inhérents ou des hypothèses erronées, vous risquez d’obtenir des données synthétiques inexactes, voire offensantes. Cela peut nuire à votre réputation, vous faire perdre des clients ou entraîner des problèmes juridiques, selon la gravité des résultats biaisés, comme les hypertrucages.

Un risque de surapprentissage

Selon la manière dont un modèle de génération de données synthétiques est entraîné, il peut commencer à ajuster excessivement les données synthétiques aux données d’entraînement qu’il utilise. Autrement dit, le modèle peut être tellement performant pour lire et suivre ses données d’entraînement qu’il commence également à tenir compte du bruit qu’elles contiennent, tout en ne prenant pas en considération les nouvelles variables ou les nouveaux scénarios de données susceptibles de se présenter lors de la génération de nouvelles données.

Le surapprentissage fait que les données synthétiques ressemblent aux données du monde réel sans en reproduire efficacement le comportement, en particulier dans des scénarios complexes et plus inhabituels qui ne suivent pas les règles établies.

Principales entreprises du secteur des données synthétiques

Diverses start-up et entreprises établies se lancent dans les produits et services de données synthétiques. Voici quelques-unes des principales entreprises de données synthétiques répondant aux besoins en données synthétiques, qu’ils soient génériques ou propres à un secteur :

Mostly.ai icon.

  • MOSTLY AI: Cette entreprise propose une plateforme de génération de données synthétiques qui prend en charge l’anonymisation des données ainsi que d’autres mesures de confidentialité et de sécurité. Elle s’associe principalement à des organisations des secteurs de la banque, de l’assurance, des télécommunications et de la santé.

Syntho icon.

  • Syntho: La plateforme de génération de données synthétiques de Syntho s’appelle Syntho Engine. Elle est conçue pour fonctionner avec différents types de données et s’intègre à plusieurs plateformes cloud tierces ainsi qu’à d’autres outils. Elle est principalement utilisée dans les secteurs de la santé, de la finance et des organismes publics.

GenRocket icon.

  • GenRocket: Cette entreprise se concentre sur la génération de données synthétiques pour les scénarios de données de test, notamment l’automatisation des données de test et les flux de travail CI/CD. Elle est utilisée non seulement dans les secteurs de la santé, de l’assurance et des services financiers, mais aussi par tout type d’entreprise qui souhaite disposer de données de test utiles pour l’entraînement de modèles d’IA/ML, les processus ETL et/ou les projets de transformation numérique.

Hazy icon.

  • Hazy: Hazy est une entreprise de synthèse de données destinée aux grandes entreprises. Elle génère de nouvelles données et optimise les données existantes pour les infrastructures numériques, la veille stratégique ainsi que les avancées et améliorations de l’IA. Elle travaille principalement avec des organisations des secteurs des services financiers, des télécommunications, de l’administration publique et de la recherche.

Synthesis AI icon.

  • Synthesis AI: Cette entreprise de synthèse de données se concentre sur la génération de données pour les tâches et initiatives de vision par ordinateur. Ses produits servent notamment à générer des avatars humains réalistes, des scénarios professionnels, des données pour la sécurité des conducteurs et des piétons, et bien plus encore.

En résumé : utiliser les données synthétiques

Les données synthétiques conviennent à une grande variété de projets et de cas d’usage métier, en particulier dans les secteurs où la confidentialité des données et la conformité réglementaire sont indispensables. Elles sont anonymisées, faciles à générer et à consulter et, surtout, conçues de manière à être abordables, évolutives et efficaces dans la plupart des flux de travail axés sur les données.

Mais si ce type de données peut s’avérer extrêmement utile, il ne l’est que si votre organisation connaît les risques, les biais et les limites potentiels liés à l’utilisation de données générées artificiellement. En plus du travail habituel de votre équipe pour nettoyer, préparer et modéliser les données destinées à l’entraînement de modèles d’apprentissage automatique et à des projets similaires, il est important d’évaluer attentivement les données d’entraînement et les processus qui interviennent dans la génération de données synthétiques. Il est en effet essentiel de savoir avec quelle précision les données générées synthétiquement imitent les données du monde réel que vous utiliseriez traditionnellement. Pour obtenir les meilleurs résultats possibles, collaborez avec une entreprise de premier plan dans le domaine des données synthétiques, en laquelle vous avez confiance et qui fait preuve de transparence tout en comprenant vos besoins particuliers en matière de données.

Pour comprendre parfaitement les fournisseurs actuels de solutions de données synthétiques, lisez notre guide : 9 meilleurs logiciels de données synthétiques

Shelby Hiter

Shelby Hiter is a writer for eWeek and several other B2B technology websites. Previously, she managed editorial strategy on TechRepublic, Webopedia, LinuxToday, and SoftwarePundit. Her work has appeared in online publications such as TechRepublic, project-management.com, Datamation, eSecurity Planet, Enterprise Networking Planet, CIO Insight, AllBusiness.com, and SiteProNews. Her current B2B tech passions include artificial intelligence, managed services, open-source software, and big data.

eWeek Logo

eWeek has the latest technology news and analysis, buying guides, and product reviews for IT professionals and technology buyers. The site's focus is on innovative solutions and covering in-depth technical content. eWeek stays on the cutting edge of technology news and IT trends through interviews and expert analysis. Gain insight from top innovators and thought leaders in the fields of IT, business, enterprise software, startups, and more.

Property of TechnologyAdvice. © 2026 TechnologyAdvice. All Rights Reserved

Advertiser Disclosure: Some of the products that appear on this site are from companies from which TechnologyAdvice receives compensation. This compensation may impact how and where products appear on this site including, for example, the order in which they appear. TechnologyAdvice does not include all companies or all types of products available in the marketplace.