Cybersicherheit

Wie falsche Daten echte Nutzer schützen: Der Wert synthetischer Daten

mm
Securities.io zu deinen bevorzugten Quellen auf Google hinzufügen
Offenlegung: Securities.io kann eine Vergütung erhalten, wenn Sie Links zu getesteten Produkten nutzen. Unsere redaktionellen Bewertungen bleiben davon unberührt. Wir sind kein registrierter Anlageberater; dies ist keine Anlageberatung. Lesen Sie unsere Affiliate-Offenlegung.

Der unstillbare Durst nach mehr Daten

As the world became more digitized, it started producing and requiring increasing amounts of data. This poses a problem, as said data is often associated with real people and real companies that might have serious privacy concerns.

Als die Welt stärker digitalisiert wurde, begann sie, immer mehr Daten zu erzeugen und zu benötigen. Das stellt ein Problem dar, da diese Daten oft mit echten Personen und realen Unternehmen verbunden sind, die ernsthafte Datenschutzbedenken haben könnten.

This has become an even bigger issue with the emergence of AI, which is able not just to do statistical analysis on batches of data but also to comb through and analyze the dataset in-depth at all levels, from an individual person to billions of numerical entries.

Dies wurde mit dem Aufkommen von KI zu einem noch größeren Problem, da sie nicht nur statistische Analysen auf Datenmengen durchführen kann, sondern auch Datensätze in der Tiefe auf allen Ebenen durchsucht und analysiert, von einzelnen Personen bis hin zu Milliarden von numerischen Einträgen.

Data is now so essential to the modern economy that demand for real, high-quality data has grown exponentially. At the same time, stricter data privacy rules and ever-larger AI models have made gathering and labeling real data increasingly difficult or impractical. – IBM Research

Dies ist der Grund, warum synthetische Daten als Lösung erfunden wurden. Diese Daten replizieren reale Daten, enthalten jedoch keine privaten Informationen, die Probleme verursachen könnten. Sie können zudem modifiziert und an spezifische Anwendungsfälle, seltene Situationen oder alles, was der Statistiker oder Tester benötigt, angepasst werden.

Auch hier hat KI eine transformative Wirkung. Einerseits ist KI‑Technologie sehr nützlich, um bessere synthetische Daten zu erzeugen, die über die bisher rein statistischen Methoden hinausgehen. Andererseits sind synthetische Daten ebenso nützlich, um KI‑Modelle zu trainieren, von simulierten 3D‑Modellen von Proteinen für die Medikamentenforschung bis hin zu Straßen für selbstfahrende KI.

Synthetic AI erklärt

Synthetic data refers to datasets that are artificially generated but retain the underlying statistical properties of the original data on which it is based.

Synthetische Daten ergänzen reale Daten und bieten einige zentrale Vorteile, die es Forschern und Analysten ermöglichen, die aus Umfragen, Experimenten und Messungen gewonnenen ersten Ergebnisse zu erweitern:

  • Training von KI‑Modellen mit synthetischen Daten ermöglicht es, das Gesamtvolumen an Daten zu erhöhen, wenn hochwertige reale Daten knapp sind.
  • In Bereichen wie Finanzen und Gesundheitswesen sind Daten begrenzt, zeitaufwendig zu beschaffen oder schwer zugänglich.

Das Forschungsunternehmen Gartner schätzt, dass synthetische Daten bis 2030 die echten Daten beim Training von KI‑Modellen übertreffen werden. Gartner prognostiziert außerdem, dass bis 2026 75 % der Unternehmen generative KI einsetzen werden, um synthetische Kundendaten zu erstellen.

Arten synthetischer Daten

Teilweise synthetische Daten verwenden reale Datensätze und ersetzen Teile davon durch künstliche Werte. Dies wird in der Regel aus Datenschutzgründen durchgeführt und ist häufig in der klinischen Forschung anzutreffen, wo die echten Identitäten von Patienten und medizinischen Aufzeichnungen anonymisiert werden.

Vollständig synthetische Daten sind ein vollständig erzeugter Datensatz, der die Eigenschaften realer Daten schätzt und versucht, sie so gut wie möglich zu emulieren: Attribute, Muster und Beziehungen. Dies kann beispielsweise zum Training verwendet werden, wenn in einem Benutzerdatensatz Daten fehlen, wie Finanzdaten ohne betrügerische Aktivitäten, die zum Training einer KI für Betrugserkennung benötigt werden.

Hybride synthetische Daten kombinieren reale Daten mit vollständig synthetischen Daten.

Wie man synthetische Daten erzeugt

Statistische Methoden sind bei weitem die älteste Methode zur Erzeugung synthetischer Daten und reichen bis in die 1930er Jahre zurück, als Audio und Stimme synthetisiert wurden, was ab den 1970er Jahren zu Software‑Synthesizern führte.

Variationale Autoencoder (VAEs) sind Programme, die Variationen der Daten erzeugen, auf denen sie trainiert wurden. Diese Systeme werden häufig zur Erzeugung synthetischer Bilder sowie anderer Formen des maschinellen Lernens eingesetzt.

Quelle: IBM


Ein verwandter Ansatz zu VAEs ist generative adversarial networks (GANs), ein bedeutender Ansatz für generative künstliche Intelligenz. Er besteht aus zwei neuronalen Netzen:
  • Eines erzeugt Daten, die versuchen, wie der reale Datensatz auszusehen.
  • Ein anderes vergleicht die erzeugten Daten mit einem realen Datensatz.

Das zweite neuronale Netzwerk gibt dem ersten Rückmeldung, bis das erste in der Lage ist, einen synthetischen Datensatz zu erzeugen, der dem realen so nahe wie möglich kommt.

Quelle: Wikipedia

Transformer‑Modelle verwenden die mathematischen Werkzeuge, die bei der Entwicklung vieler moderner KIs, einschließlich ChatGPT (bei dem „T“ für „Transformer“ steht), zum Einsatz kommen. Sie „raten“ die statistisch wahrscheinlichste Ausgabesequenz, indem sie sich auf die wichtigsten Tokens in der Eingabesequenz konzentrieren.

Schließlich geht agentenbasiertes Modellieren noch einen Schritt weiter und erstellt „Agenten“, Mini‑KIs, die Interaktionen und das Verhalten von Agenten simulieren, um synthetische Daten zu erzeugen. Beispielsweise können einzelne Agenten einzelne Personen in einer epidemiologischen Studie repräsentieren, wobei jeder sein eigenes Kontaktmuster, Infektionsrisiko usw. aufweist.

(Wir haben die zukünftige Rolle von KI‑Agenten am Arbeitsplatz und im täglichen Leben in “KI’s Killer App: Wie KI‑Agenten alles verändern könnten”)

Vorteile synthetischer Daten

Kontrolle & Anpassung

Da die Daten von Grund auf neu erstellt werden, ist es viel einfacher, den richtigen Datensatz für eine gegebene Aufgabe zu produzieren, zum Beispiel das Training eines KI‑Systems.

Sie können zudem exakt nach den Vorgaben und Bedürfnissen eines Unternehmens oder Forschers erstellt werden.

Effizienz

Die Erzeugung von Daten eliminiert die Notwendigkeit einer teuren und zeitaufwändigen Sammlung realer Daten, zumindest solange die generierten synthetischen Daten der Realität hinreichend nahekommen.

Diese Daten sind zudem bereits vorbeschriftet, wodurch der mühsame manuelle Schritt entfällt, jedes Datenpunkt von einem Menschen zu kennzeichnen, jedes Bild, jeden Satz oder jede Audiodatei zu beschreiben, damit ein automatisiertes System sie verstehen kann.

Datenschutz

Vollständig synthetische Daten haben keinerlei Datenschutzprobleme, da sie nicht mit realen Personen oder Unternehmen verknüpft sind. Andere Formen synthetischer Daten sind eine gute Möglichkeit, reale Daten von geschützten Informationen zu anonymisieren und zu „säubern“, sei es individuelle private Daten oder urheberrechtlich geschützte bzw. anderweitig geschützte geistige Eigentumsrechte.

Quelle: Mostly AI

Vielfältigere Daten

Zu kleine reale Datensätze können Randfälle oder unterrepräsentierte Gruppen übersehen. Das kann beim Training von KIs problematisch sein, da das resultierende Modell die Existenz dieser Fälle vollständig ignorieren würde.

Durch die Erweiterung des ursprünglichen Datensatzes und das künstliche Hinzufügen des fehlenden Falls, von dem der Designer weiß, dass er existieren sollte, können die resultierenden hybriden synthetischen Daten genauer und repräsentativer für reale Situationen sein.

Grenzen synthetischer Daten

Datenverlust

Selbst wenn synthetische Daten idealerweise praktisch identisch mit realen Daten sind, kann im Prozess ein gewisser Informationsverlust auftreten. Dies gilt besonders bei starker Anonymisierung. Daher muss manchmal ein Gleichgewicht zwischen Datenschutz und Effizienz gefunden werden.

Voreingenommenheit

Da synthetische Daten stark bemüht sind, reale Datensätze zu replizieren, werden sie wahrscheinlich auch etwaige Fehler, Voreingenommenheiten oder Probleme, die darin vorkommen, nachahmen. Daher ist es oft wichtig, beim Erstellen synthetischer Daten mehrere reale Datensätze aus verschiedenen Regionen, demografischen Gruppen, Zeiträumen usw. zu mischen.

Die Treue synthetischer Daten wird berechnet, indem sie durch statistische und analytische Tests mit realen Daten verglichen werden. Dies beinhaltet eine Bewertung, wie gut die synthetischen Daten zentrale statistische Eigenschaften wie Mittelwerte, Varianzen und Korrelationen zwischen Variablen bewahren.
Raul Salles de Padua – Leiter der Technik, KI und Quanten bei Multiverse Computing

Modellkollaps

Das KI‑Training kann scheitern, wenn es beginnt, zu viel von seiner eigenen Ausgabe zu trainieren. Mehr Training mit KI‑generierten Daten führt zu abnehmender Qualität, die dann als Eingabe des nächsten Trainingszyklus dient, was zur „Degeneration“ des KI‑Modells und dessen Kollaps führt.

Aus diesem Grund wird allgemein empfohlen, reale Daten mit synthetischen Daten zu mischen.

Das Training mit Stichproben aus einem anderen generativen Modell kann eine Verteilungsverschiebung induzieren, die – im Laufe der Zeit – zum Modellkollaps führt. Dies wiederum führt dazu, dass das Modell die zugrunde liegende Lernaufgabe missversteht.

Um das Lernen über einen langen Zeitraum aufrechtzuerhalten, müssen wir sicherstellen, dass der Zugriff auf die ursprüngliche Datenquelle erhalten bleibt und dass weitere Daten, die nicht von LLMs generiert wurden, über die Zeit hinweg verfügbar bleiben.

KI‑Modelle kollabieren, wenn sie mit rekursiv generierten Daten trainiert werden – Nature.

Anwendungsfälle synthetischer Daten

Selbstfahrende Autos

Da reale Daten von Stadtstraßen in ausreichender Menge schwer zu sammeln sind, nutzen die meisten Unternehmen für selbstfahrende KI synthetische Daten zumindest teilweise. Diese simulierten Straßen, komplett mit lebensnahen Fahrrädern, Autos, Fußgängern und zufälligen beweglichen Objekten, können das Training der selbstfahrenden KI mit vielen zusätzlichen Stunden virtueller Erfahrung unterstützen und so die Gesamtkosten des Trainings senken.

Finanzen

Von prädiktiven Modellen für Investitionen und Risiken (Handel, Banken, Versicherungen) bis hin zur Betrugserkennung nutzen Finanzunternehmen synthetische Daten, um Risiken, Betrug und Geldwäsche besser zu erkennen.

Hier geht es nicht nur darum, diese Risiken korrekt zu erkennen, sondern auch die Management‑Teams der Unternehmen sollen Regulierungsbehörden und Stakeholdern zeigen, dass alle Anstrengungen unternommen werden, um diese Probleme zu erkennen und zu vermeiden, was potenziell Milliarden an Verlusten oder Strafen verhindern kann.

Gesundheitswesen

Durch die Erhöhung der gesamten „Erfahrung“ einer KI im Training können synthetische Daten helfen, Modelle zu trainieren, die später in der Epidemiologie, bei der Analyse medizinischer Bilder & Laborergebnisse oder in klinischen Studien eingesetzt werden.

Solche KIs können später retrospektiv an bekannten Kohorten und Bevölkerungsstudien getestet werden, um die Genauigkeit ihrer Vorhersagen zu belegen.

Anbieter synthetischer Daten – Tonic.ai

Die meisten Unternehmen, die synthetische Daten verwenden, greifen häufig auf externe Anbieter zurück, die sich auf dieses Gebiet spezialisiert haben.

Ein Beispiel dafür ist Tonic.ai, das sich praktisch mit jeder Datenbank integrieren lässt und Daten‑Mining, Entwicklung und Tests mit den eigenen realen Daten des Kunden ermöglicht.

Quelle: Tonic.ai

Zu den von dem Unternehmen angebotenen Dienstleistungen gehören:

Quelle: Tonic.ai

Tonic.ai‑Tools werden von vielen großen Unternehmen verwendet, wie zum Beispiel eBay‑Entwicklern, American Express (AXP ) (siehe unten), Volvo, Cigna, Walgreens, usw.

Nutzer synthetischer Daten – American Express

AXP Preisdiagramm

Einer der weltweit führenden Kreditkartenanbieter, American Express, steht an vorderster Front bei der Nutzung synthetischer Daten für geschäftliche Zwecke, nutzt bereits vor 2020 Deep Learning und verwendet Nvidia (NVDA ) ‑Hardware.

KI-Anwendungen für Kunden

Bemerkenswerterweise wurde berichtet, dass es “KI‑generierte gefälschte Betrugsmuster verwendet, um die Fähigkeit seiner Modelle zu schärfen, seltene oder ungewöhnliche Betrugsversuche zu erkennen

\”Diese Techniken haben einen erheblichen Einfluss auf das Kundenerlebnis, indem sie es American Express ermöglichen, die Erkennungs­geschwindigkeit zu verbessern und Verluste zu verhindern, indem der Entscheidungs­prozess automatisiert wird.”Dmitry Efimov – Vizepräsident für Forschung im Bereich maschinelles Lernen bei American Express

Es nutzt zudem KI und synthetische Daten, um die Kreditrisikobewertung zu optimieren, indem sogar soziales Verhalten und Echtzeit‑Marktbedingungen einbezogen werden.

Sie wird außerdem, insbesondere mit generativer KI, eingesetzt, um den Kundenservice zu verbessern und die Fälle zu reduzieren, in denen der Chatbot des Unternehmens nicht ausreicht, um Kundenanfragen zu beantworten.

Gleichzeitig analysieren KI‑Algorithmen das Ausgabeverhalten, die Vorlieben und die Transaktionshistorie der Kunden, um maßgeschneiderte Angebote und Prämien vorzuschlagen.

Interne KI-Anwendungen

Internally hat KI es American Express ermöglicht, die Eskalation zu IT‑Tickets durch ein reaktives Problemlösungs‑System zu reduzieren, und die 9.000 Ingenieure des Unternehmens nutzen jetzt GitHub Copilot zur Unterstützung beim Codieren.

Sie unterstützt zudem die 5.000 Reiseberater, die die exklusivsten Centurion‑ (schwarzen) und Platinum‑Karteninhaber des Unternehmens beraten.

“Reiseberater werden über viele verschiedene Bereiche hinweg beansprucht. Zum Beispiel könnte ein Kunde nach den unbedingt zu besuchenden Orten in Barcelona fragen, während der nächste nach Fünf‑Sterne‑Restaurants in Buenos Aires erkundigt. Es ist, als müsste man all das im Kopf einer Person behalten, richtig?”Hilary Packer, Amex EVP und CTO

Überblick über American Express

Neben KI und synthetischen Daten ist American Express ein solides Finanzunternehmen, das für 2025 ein Umsatzwachstum von 8‑10 % erwartet, im Einklang mit dem langfristigen Ziel für das Umsatzwachstum, sowie einen Gewinn pro Aktie von 12‑16 %.

Das Unternehmen expandiert zudem schnell international, nach einer langen Phase, in der es hauptsächlich auf dem US‑Markt präsent war, mit einem jährlichen Wachstum von 15 % im internationalen Kartenservice‑Umsatz.

Neueste Nachrichten zu American Express

Jonathan ist ein ehemaliger Biochemie‑Forscher, der in der genetischen Analyse und in klinischen Studien gearbeitet hat. Er ist jetzt Aktienanalyst und Finanzautor mit einem Fokus auf Innovation, Marktzyklen und Geopolitik in seiner Veröffentlichung 'The Eurasian Century'.