Cybersécurité

Comment les fausses données protègent les utilisateurs réels : la valeur des données synthétiques

mm
Ajouter Securities.io à vos sources préférées sur Google
Divulgation : Securities.io peut recevoir une compensation via les liens vers les produits évalués. Cela n’influence pas nos évaluations éditoriales. Nous ne sommes pas un conseiller en placement inscrit ; ceci ne constitue pas un conseil en placement. Consultez notre politique d’affiliation.

La soif infinie de plus de données

À mesure que le monde se numérisait, il a commencé à produire et à nécessiter des quantités croissantes de données. Cela pose un problème, car ces données sont souvent associées à de vraies personnes et à de vraies entreprises, ce qui peut soulever de graves problèmes de confidentialité.

Cela est devenu un problème encore plus important avec l’émergence de l’IA, qui peut non seulement effectuer des analyses statistiques sur des lots de données, mais aussi parcourir et analyser le jeu de données en profondeur à tous les niveaux, d’une personne individuelle à des milliards d’entrées numériques.

Les données sont désormais si essentielles à l’économie moderne que la demande de données réelles et de haute qualité a explosé. En même temps, des règles de confidentialité des données plus strictes et des modèles d’IA toujours plus grands ont rendu la collecte et l’étiquetage de données réelles de plus en plus difficiles ou impraticables. – IBM Research

C’est pourquoi les données synthétiques ont été créées comme solution. Ces données reproduisent les données du monde réel mais ne contiennent aucune donnée privée pouvant poser problème. Elles peuvent également être modifiées et adaptées à des cas d’utilisation spécifiques, à des situations rares, ou à tout ce dont le statisticien ou le testeur a besoin.

L’IA a également été transformatrice ici. D’une part, la technologie d’IA est très utile pour générer de meilleures données synthétiques, allant au-delà des méthodes purement statistiques utilisées jusqu’à présent. D’autre part, les données synthétiques sont tout aussi utiles pour entraîner les modèles d’IA, des modèles 3D simulés de protéines pour la découverte de médicaments aux rues pour l’IA de conduite autonome.

L’IA synthétique expliquée

Les données synthétiques désignent des ensembles de données générés artificiellement mais qui conservent les propriétés statistiques sous-jacentes des données originales sur lesquelles elles sont basées.

Les données synthétiques complètent les données du monde réel et offrent plusieurs avantages clés qui permettent aux chercheurs et aux analystes d’étendre les résultats initiaux recueillis à partir d’enquêtes, d’expériences et de mesures:

  • Entraîner des modèles d’IA avec des données synthétiques nous permet d’augmenter le volume global de données lorsque les données réelles de haute qualité sont rares.
  • Dans des secteurs comme la finance et la santé, les données sont en quantité limitée, leur obtention prend du temps ou elles sont difficiles d’accès.

La société de recherche Gartner estime qu’en 2030, les données synthétiques dépasseront les données réelles dans l’entraînement des modèles d’IA. Gartner prévoit également qu’en 2026, 75 % des entreprises utiliseront l’IA générative pour créer des données clients synthétiques.

Types de données synthétiques

Données partiellement synthétiques utilisent des ensembles de données du monde réel et remplacent des parties de celles-ci par des valeurs artificielles. Cela se fait généralement pour des raisons de confidentialité et est couramment utilisé dans la recherche clinique, où les identités réelles des patients et les dossiers médicaux sont anonymisés.

Données entièrement synthétiques sont un ensemble de données entièrement généré, estimant les caractéristiques des données réelles et essayant de les reproduire du mieux possible: attributs, motifs et relations. Cela peut, par exemple, être fait pour entraîner un modèle en comblant des données manquantes d’un ensemble d’utilisateurs, comme des données financières dépourvues d’activités frauduleuses, nécessaires pour entraîner une IA à la détection de fraudes.

Données synthétiques hybrides combinent des données réelles avec des données entièrement synthétiques.

Comment générer des données synthétiques

Méthodes statistiques sont de loin les plus anciennes méthodes pour générer des données synthétiques, remontant aux années 1930 avec la synthèse audio et vocale, menant aux synthétiseurs logiciels depuis les années 1970.

Auto‑encodeurs variationnels (VAEs) sont des programmes qui produisent des variations sur les données sur lesquelles ils sont entraînés. Ces systèmes sont souvent utilisés pour générer des images synthétiques, ainsi que d’autres formes d’apprentissage automatique.

Source: IBM

Une approche liée aux VAEs est les réseaux antagonistes génératifs (GANs), une approche majeure de l’intelligence artificielle générative. Elle est composée de deux réseaux neuronaux:

  • L’un génère des données qui tentent de ressembler au jeu de données réel.
  • L’autre compare les données générées à un jeu de données réel.

Le deuxième réseau neuronal fournit des retours au premier jusqu’à ce que ce dernier puisse générer un ensemble de données synthétique aussi proche que possible du réel.

Source: Wikipedia

Modèles transformeurs utilisent les outils mathématiques employés dans le développement de nombreuses IA modernes, y compris ChatGPT (où le « T » signifie « transformer »). Ils « devinent » la séquence de sortie la plus statistiquement probable en se concentrant sur les tokens les plus importants de la séquence d’entrée.

Enfin, la modélisation basée sur les agents va un pas plus loin et crée des « agents », de petites IA qui simulent les interactions et les comportements des agents afin de produire des données synthétiques. Par exemple, des agents individuels peuvent représenter des personnes individuelles dans une étude épidémiologique, chacune affichant son propre schéma ou taux de contact, de risque d’infection, etc.

(Nous avons exploré le rôle futur des agents IA dans le lieu de travail et la vie quotidienne dans « L’application meurtrière de l’IA : comment les agents IA pourraient tout changer»)

Avantages des données synthétiques

Contrôle et personnalisation

Comme les données sont créées à partir de zéro, il est beaucoup plus facile de produire l’ensemble de données correct pour une tâche donnée, par exemple l’entraînement d’un système d’IA.

Elles peuvent également être créées selon les spécifications exactes et les besoins d’une entreprise ou d’un chercheur.

Efficacité

La génération de données élimine le besoin de collecter des données réelles coûteuses et chronophages, tant que les données synthétiques générées sont suffisamment proches des données du monde réel.

Ces données sont également pré‑étiquetées, ce qui supprime l’étape manuelle fastidieuse consistant à étiqueter chaque point de données par un humain, en décrivant chaque image, phrase ou fichier audio afin qu’un système automatisé puisse les comprendre.

Confidentialité

Les données entièrement synthétiques n’ont aucun problème lié à la confidentialité, car elles ne sont liées à aucune personne ou entreprise réelle. D’autres formes de données synthétiques constituent un bon moyen d’anonymiser et de « nettoyer » les données réelles de toute information protégée, qu’il s’agisse de données privées individuelles ou de propriétés intellectuelles protégées par le droit d’auteur ou autrement.

Source: Mostly AI

Données plus diverses

Des ensembles de données du monde réel trop petits peuvent manquer des cas limites ou des groupes sous‑représentés. Cela peut poser problème lors de l’entraînement des IA, car le modèle résultant ignorerait complètement l’existence de ces cas.

En élargissant l’ensemble de données initial et en ajoutant artificiellement le cas manquant que le concepteur sait devoir exister, les données synthétiques hybrides résultantes peuvent être plus précises et représentatives des situations réelles.

Limites des données synthétiques

Perte de données

Même si, idéalement, les données synthétiques sont pratiquement identiques aux données réelles, un certain niveau d’information peut être perdu lors du processus. Cela est particulièrement vrai avec une forte anonymisation. Ainsi, il faut parfois trouver un équilibre entre confidentialité et efficacité.

Biais

Comme les données synthétiques s’efforcent de reproduire les ensembles de données du monde réel, elles sont également susceptibles de reproduire toute erreur, biais ou problème qui s’y trouve. Il est donc souvent important de mélanger plusieurs ensembles de données réelles provenant de différentes régions, groupes démographiques, périodes, etc., lors de la création de données synthétiques.

“La fidélité des données synthétiques est calculée en les comparant aux données du monde réel à l’aide de tests statistiques et analytiques. Cela comprend une évaluation de la façon dont les données synthétiques préservent les propriétés statistiques clés, telles que les moyennes, les variances et les corrélations entre les variables.”

Raul Salles de Padua – Directeur de l’ingénierie, IA et Quantum chez Multiverse Computing

Effondrement du modèle

L’entraînement de l’IA peut échouer lorsqu’il commence à s’entraîner sur trop de ses propres sorties. Un entraînement supplémentaire à partir de données générées par l’IA entraîne une baisse de qualité, qui devient l’entrée du cycle d’entraînement suivant, conduisant à la « dégénérescence » du modèle d’IA et à son effondrement.

Pour cette raison, il est généralement recommandé de mélanger des données réelles avec des données synthétiques.

“Entraîner sur des échantillons d’un autre modèle génératif peut induire un décalage de distribution, qui—au fil du temps—cause l’effondrement du modèle. Cela conduit à ce que le modèle perçoive mal la tâche d’apprentissage sous‑jacente.

Pour maintenir l’apprentissage sur une longue période, nous devons nous assurer que l’accès à la source de données originale est préservé et que des données supplémentaires non générées par les LLM restent disponibles au fil du temps.

Les modèles d’IA s’effondrent lorsqu’ils sont entraînés sur des données générées de manière récursive – Nature.

Cas d’utilisation des données synthétiques

Conduite autonome

Comme les données réelles des rues de ville peuvent être difficiles à collecter en nombre suffisant, la plupart des entreprises d’IA de conduite autonome utilisent dans une certaine mesure des données synthétiques. Ces rues simulées, complètes avec des vélos, voitures, piétons et objets mobiles aléatoires réalistes, peuvent aider à entraîner l’IA de conduite autonome avec beaucoup plus d’heures d’expérience virtuelle, réduisant le coût global de l’entraînement.

Finance

Des modèles prédictifs pour l’investissement et les risques (trading, banques, assurances) à la détection de fraudes, les entreprises financières utilisent des données synthétiques pour améliorer la détection des risques, des fraudes et du blanchiment d’argent.

Dans ce cas, l’objectif n’est pas seulement de détecter correctement ces risques, mais aussi pour les équipes de direction des entreprises de démontrer aux régulateurs et aux parties prenantes que tous les efforts sont déployés pour détecter et éviter ces problèmes, pouvant potentiellement éviter des milliards de pertes ou d’amendes.

Santé

En augmentant l’« expérience » totale d’une IA pendant son entraînement, les données synthétiques peuvent aider à entraîner des modèles ultérieurement utilisés en épidémiologie, analyse d’images médicales et de résultats de laboratoire, ou essais cliniques.

Ces IA peuvent ensuite être testées rétroactivement sur des cohortes connues et des études de population, prouvant la précision de leurs prédictions.

Fournisseur de données synthétiques – Tonic.ai

La plupart des entreprises utilisant des données synthétiques ont tendance à s’appuyer sur des fournisseurs externes spécialisés dans ce domaine.

Un exemple est Tonic.ai, qui peut s’intégrer à pratiquement toutes les bases de données, permettant l’exploration de données, le développement et les tests en utilisant les propres données réelles du client.

Source: Tonic.ai

Parmi les services proposés par la société, on peut citer:

Source: Tonic.ai

Les outils de Tonic.ai sont utilisés par de nombreuses grandes entreprises, comme les développeurs eBay, American Express (AXP ) (voir ci‑dessous), Volvo, Cigna, Walgreens, etc.

Utilisateur de données synthétiques – American Express

AXP Graphique du prix

L’un des principaux fournisseurs de cartes de crédit au monde, American Express, est à la pointe de l’utilisation des données synthétiques à des fins commerciales, utilisant déjà l’apprentissage profond avant 2020 et utilisant du matériel Nvidia (NVDA ).

Utilisations de l’IA pour les clients

Il a notamment été signalé qu’elle utilise « des modèles de fraude factices générés par l’IA pour affiner la capacité de ses modèles à détecter des escroqueries rares ou inhabituelles ».

« Ces techniques ont un impact considérable sur l’expérience client, permettant à American Express d’améliorer la rapidité de détection et de prévenir les pertes en automatisant le processus de prise de décision. »
Dmitry Efimov – vice‑président de la recherche en apprentissage automatique chez American Express

Elle utilise également l’IA et les données synthétiques pour rationaliser l’évaluation du risque de crédit en incluant même le comportement social et les conditions du marché en temps réel.

Elle est également utilisée, notamment avec l’IA générative, pour améliorer le service client et réduire les cas où le chatbot de l’entreprise ne parvient pas à répondre aux demandes des clients.

Parallèlement, les algorithmes d’IA analysent les comportements de dépenses des clients, leurs préférences et leurs historiques de transactions afin de proposer des offres et des récompenses personnalisées.

Utilisations internes de l’IA

En interne, l’IA a permis à American Express de réduire les escalades vers les tickets informatiques grâce à un système de résolution de problèmes réactif, et les 9 000 ingénieurs de l’entreprise utilisent désormais GitHub Copilot pour l’assistance au codage.

Elle aide également les 5 000 conseillers voyages qui conseillent les membres les plus prestigieux des cartes Centurion (noire) et Platinum de la société.

« Les conseillers voyages sont sollicités dans de nombreux domaines différents. Par exemple, un client peut demander les sites incontournables à Barcelone, tandis qu’un autre s’enquiert des restaurants cinq étoiles de Buenos Aires. C’est essayer de garder tout cela dans la tête de quelqu’un, n’est‑ce pas ? »
Hilary Packer, Amex EVP et CTO

Aperçu d’American Express

En plus de l’IA et des données synthétiques, American Express est une société financière solide, prévoyant une croissance de ses revenus de 8 à 10 % en 2025, conformément à son objectif à long terme de croissance du chiffre d’affaires, et un bénéfice par action en hausse de 12 à 16 %.

L’entreprise se développe également rapidement à l’international, après une longue période où elle était principalement présente sur le marché américain, avec une croissance de 15 % d’une année sur l’autre dans les services de cartes internationales facturés.

Dernières nouvelles sur American Express

Jonathan est un ancien chercheur en biochimie qui a travaillé dans l'analyse génétique et les essais cliniques. Il est maintenant analyste boursier et rédacteur financier, spécialisé dans l'innovation, les cycles de marché et la géopolitique dans sa publication 'The Eurasian Century'.