Cybersikkerhed

Hvordan falske data beskytter rigtige brugere: Værdien af syntetiske data

mm
Føj Securities.io til dine foretrukne kilder på Google
Oplysning: Securities.io kan modtage betaling, når du bruger links til produkter, vi anmelder. Det påvirker ikke vores redaktionelle vurderinger. Vi er ikke registreret investeringsrådgiver; dette er ikke investeringsrådgivning. Læs vores affiliateoplysning.

Den uendelige tørst efter mere data

Efterhånden som verden blev mere digitaliseret, begyndte den at producere og kræve stigende mængder data. Dette udgør et problem, da disse data ofte er knyttet til rigtige mennesker og rigtige virksomheder, som kan have alvorlige privatlivsbekymringer.

Dette er blevet et endnu større problem med fremkomsten af AI, som ikke kun kan udføre statistisk analyse på datamængder, men også kan gennemgå og analysere datasættet i dybden på alle niveauer, fra en enkelt person til milliarder af numeriske poster.

Data er nu så afgørende for den moderne økonomi, at efterspørgslen efter ægte, høj‑kvalitetsdata er vokset eksponentielt. Samtidig har strengere databeskyttelsesregler og stadigt større AI‑modeller gjort indsamling og mærkning af rigtige data stadig vanskeligere eller upraktisk. – IBM Research

Det er derfor, syntetiske data blev opfundet som en løsning. Disse data efterligner virkelige data, men indeholder ingen private oplysninger, der kan skabe problemer. De kan også modificeres og tilpasses specifikke anvendelsestilfælde, sjældne situationer eller alt, hvad statistikeren eller testeren har brug for.

Her også har AI været transformerende. På den ene side er AI‑teknologi meget nyttig til at generere bedre syntetiske data, der går ud over de tidligere rent statistiske metoder. På den anden side er syntetiske data lige så nyttige til at træne AI‑modeller, fra simulerede 3D‑modeller af proteiner til drug discovery til gader for selvkørende AI.

Forklaring af syntetisk AI

Syntetiske data refererer til datasæt, der kunstigt genereres, men bevarer de underliggende statistiske egenskaber fra de originale data, de er baseret på.

Syntetiske data fungerer som et supplement til virkelige data og giver nogle nøglefordele, der gør det muligt for forskere og analytikere at udvide de indledende resultater indsamlet fra undersøgelser, eksperimenter og målinger:

  • Træning af AI‑modeller med syntetiske data gør det muligt at øge den samlede datamængde, når høj‑kvalitets virkelige data er knappe.
  • I sektorer som finans og sundhedspleje er data i begrænset udbud, tidskrævende at indhente eller svære at få adgang til.

Forskningsfirmaet Gartner anslår, at syntetiske data inden 2030 vil overhale faktiske data i træning af AI‑modeller. Gartner forudsiger også, at inden 2026 vil 75 % af virksomheder anvende generativ AI til at skabe syntetiske kundedata.

Typer af syntetiske data

Partielt syntetiske data bruger virkelige datasæt og erstatter dele af dem med kunstige værdier. Dette gøres typisk af hensyn til privatliv og anvendes ofte i klinisk forskning, hvor patienters rigtige identiteter og medicinske journaler anonymiseres.

Fuldt syntetiske data er et fuldstændigt genereret datasæt, der estimerer karakteristika fra virkelige data og forsøger at efterligne dem så præcist som muligt: attributter, mønstre og relationer. Dette kan for eksempel bruges til at træne mod manglende data i et brugerdatasæt, såsom finansielle data uden svigaktiviteter, som er nødvendige for at træne en AI til svigdetektion.

Hybrid syntetiske data kombinerer virkelige data med fuldt syntetiske data.

Hvordan man genererer syntetiske data

Statistiske metoder er med langt den ældste metode til at generere syntetiske data, der går tilbage til 1930’erne med syntese af lyd og stemme, hvilket førte til software‑synthesizere fra 1970’erne og frem.

Variationale autoencodere (VAEs) er programmer, der producerer variationer af de data, de er trænet på. Disse systemer bruges ofte til at generere syntetiske billeder samt andre former for maskinlæring.

Kilde: IBM


En relateret tilgang til VAEs er generative adversarial networks (GANs), en hovedmetode inden for generativ kunstig intelligens. Den består af to neurale netværk:
  • Det ene genererer data, der forsøger at ligne det virkelige datasæt.
  • Det andet sammenligner de genererede data med et virkeligt datasæt.

Det andet neurale netværk giver feedback til det første, indtil det første kan generere et syntetisk datasæt, der er så tæt som muligt på det virkelige.

Kilde: Wikipedia

Transformer‑modeller bruger de matematiske værktøjer, der anvendes i udviklingen af mange moderne AI‑systemer, inklusive ChatGPT (hvor “T” står for “transformer”). De “gætter” den mest statistisk sandsynlige output‑sekvens ved at fokusere på de vigtigste tokens i input‑sekvensen.

Endelig går agent‑baseret modellering et skridt videre og skaber “agenter”, mini‑AI’er, der simulerer interaktioner og agentadfærd for at producere syntetiske data. For eksempel kan individuelle agenter repræsentere enkelte personer i en epidemiologisk undersøgelse, hver med sit eget mønster eller kontakt‑, infektions‑ og risikorate.

(Vi udforskede den fremtidige rolle for AI‑agenter på arbejdspladsen og i dagligdagen i “AI’s Killer App: How AI Agents Could Change Everything”)

Fordele ved syntetiske data

Kontrol og tilpasning

Da dataene skabes fra bunden, er det meget lettere at producere det korrekte datasæt til en given opgave, for eksempel træning af et AI‑system.

De kan også oprettes efter de præcise specifikationer og behov for en virksomhed eller forsker.

Effektivitet

Genereringen af data fjerner behovet for dyr og tidskrævende indsamling af virkelige data, så længe de genererede syntetiske data er tilstrækkeligt tæt på data fra den virkelige verden.

Disse data leveres også forud‑mærket, hvilket fjerner den kedelige manuelle opgave med at mærke hvert datapunkt manuelt, beskrive hvert billede, hver sætning eller hver lydfil, så et automatiseret system kan forstå dem.

Privatliv

Fuldt syntetiske data har ingen privatlivsrelaterede problemer, da de ikke er knyttet til nogen virkelige personer eller virksomheder. Andre former for syntetiske data er en god måde at anonymisere og “rense” virkelige data for enhver beskyttet information, hvad enten det er individuelle private data eller ophavsretligt eller på anden måde beskyttede intellektuelle ejendomme.

Kilde: Mostly AI

Mere mangfoldige data

Alt for små virkelige datasæt kan overse kant‑cases eller underrepræsenterede grupper. Dette kan være et problem ved træning af AI, da den resulterende model helt ville ignorere eksistensen af disse tilfælde.

Ved at udvide det oprindelige datasæt og kunstigt tilføje den manglende case, som designeren ved, bør eksistere, kan de resulterende hybride syntetiske data blive mere nøjagtige og repræsentative for virkelige situationer.

Begrænsninger ved syntetiske data

Datatab

Selvom syntetiske data i teorien er næsten identiske med virkelige data, kan der gå noget information tabt i processen. Dette er især sandt ved stærk anonymisering. Så en balance mellem privatliv og effektivitet skal nogle gange findes.

Bias

Da syntetiske data gør en stor indsats for at efterligne virkelige datasæt, er de også tilbøjelige til at reproducere enhver fejl, bias eller problem, der findes i dem. Derfor er det ofte vigtigt at blande flere virkelige datasæt fra forskellige regioner, demografiske grupper, tidsrammer osv., når man skaber syntetiske data.

“Fideliteten af syntetiske data beregnes ved at sammenligne dem med virkelige data gennem statistiske og analytiske tests. Dette inkluderer en vurdering af, hvor godt de syntetiske data bevarer nøgle‑statistiske egenskaber, såsom gennemsnit, varians og korrelationer mellem variable.”

Raul Salles de Padua – Director of Engineering, AI and Quantum at Multiverse Computing

Modelkollaps

AI‑træning kan fejle, når den begynder at træne på for meget af sit eget output. Mere træning på AI‑genererede data skaber faldende kvalitet, som så bliver input til den næste træningscyklus, hvilket fører til “degeneration” af AI‑modellen og dens kollaps.

Af den grund anbefales det generelt at blande virkelige data med syntetiske data.

“Træning på prøver fra en anden generativ model kan inducere et distributionsskift, som—over tid—forårsager modelkollaps. Dette får modellen til at misforstå den underliggende læringsopgave.

For at opretholde læring over en længere periode skal vi sikre, at adgangen til den oprindelige datakilde bevares, og at yderligere data, der ikke er genereret af LLM’er, forbliver tilgængelige over tid.”
AI models collapse when trained on recursively generated data – Nature.

Anvendelsesområder for syntetiske data

Selvkørende

Da virkelige data fra bygader kan være svære at indsamle i tilstrækkeligt antal, bruger de fleste selvkørende AI‑virksomheder syntetiske data i en eller anden grad. Disse simulerede gader, komplet med livagtige cykler, biler, fodgængere og tilfældige bevægelige objekter, kan hjælpe med at træne den selvkørende AI med mange flere timers virtuel erfaring, hvilket sænker de samlede træningsomkostninger.

Finans

Fra forudsigelsesmodeller for investering og risici (handel, banker, forsikring) til svigdetektion bruger finansvirksomheder syntetiske data for bedre at opdage risici, svig og hvidvask.

Her er anvendelsen ikke kun at opdage disse risici korrekt, men også for virksomhedens ledelsesteam at demonstrere over for regulatorer og interessenter, at al mulig indsats gøres for at opdage og undgå disse problemer, hvilket potentielt kan forhindre milliarder i tab eller bøder.

Sundhedssektoren

Ved at øge den samlede “erfaring” for en AI i træning kan syntetiske data hjælpe med at træne modeller, der senere bruges i epidemiologi, medicinsk billed‑ og laboratorieresultatanalyse eller kliniske forsøg.

Sådanne AI‑systemer kan senere retroaktivt testes på kendte kohorter og befolkningsstudier, hvilket beviser nøjagtigheden af deres forudsigelser.

Syntetisk dataudbyder – Tonic.ai

De fleste virksomheder, der bruger syntetiske data, har en tendens til at stole på eksterne udbydere, der specialiserer sig inden for dette felt.

Et eksempel på dette er Tonic.ai, som kan integrere med praktisk talt enhver database og muliggør data‑mining, udvikling og test ved brug af kundens egne virkelige data.

Kilde: Tonic.ai

Blandt de tjenester, som virksomheden tilbyder, kan nævnes:

Kilde: Tonic.ai

Tonic.ai‑værktøjer bruges af mange store virksomheder, såsom eBay‑udviklere, American Express (AXP ) (se nedenfor), Volvo, Cigna, Walgreens osv.

Syntetisk data bruger – American Express

AXP Prisdiagram

En af verdens førende kreditkortudbydere, American Express, har været i frontlinjen for brug af syntetiske data til forretningsformål, allerede brugt dyb læring før 2020 og anvender Nvidia (NVDA ) ‑hardware.

AI‑brug for kunder

Det er bemærkelsesværdigt, at de rapporteres at bruge “AI‑genererede falske svigmønstre for at skærpe modellernes evne til at opdage sjældne eller usædvanlige bedragerier”.

Disse teknikker har en betydelig indvirkning på kundeoplevelsen, idet de gør det muligt for American Express at forbedre hastigheden af detektion og forhindre tab ved at automatisere beslutningsprocessen.”
Dmitry Efimov – vice president of machine learning research at American Express

Det bruges også til at strømline kreditrisikovurdering ved at inkludere social adfærd og real‑time markedsforhold.

Det anvendes også, især med generativ AI, til at forbedre kundeservice og reducere de situationer, hvor virksomhedens chatbot er utilstrækkelig til at besvare kundernes forespørgsler.

Samtidig analyserer AI‑algoritmer kundernes forbrugsadfærd, præferencer og transaktionshistorik for at foreslå skræddersyede tilbud og belønninger.

Intern AI‑brug

Internt har AI gjort det muligt for American Express at reducere eskalering til IT‑tickets gennem et reaktivt problemløsningssystem, og virksomhedens 9.000 ingeniører bruger nu GitHub Copilot til kodningsassistance.

Det hjælper også de 5.000 rejsekonsulenter, der rådgiver firmaets mest elite Centurion (sort) kort‑ og Platinum‑kortmedlemmer.

“Rejsekonsulenterne får strakt over mange forskellige områder. For eksempel kan en kunde spørge om must‑visit‑steder i Barcelona, mens den næste efterspørger Buenos Aires’ femstjernede restauranter. Det er at holde alt det i én persons hoved, ikke?”
Hilary Packer, Amex EVP and CTO

American Express oversigt

Udover AI og syntetiske data er American Express en solid finansvirksomhed, der forventer en omsætningsvækst på 8‑10 % i 2025, i overensstemmelse med det langsigtede mål for omsætningsvækst, samt en indtjening pr. aktie på 12‑16 %.

Virksomheden udvider også hurtigt internationalt efter en længere periode, hvor den primært var til stede på det amerikanske marked, med en vækst på 15 % år‑over‑år i den internationale kortservice‑faktureringsforretning.

Seneste om American Express

Jonathan er en tidligere biokemisk forsker, der arbejdede med genetisk analyse og kliniske forsøg. Han er nu aktieanalytiker og finansskribent med fokus på innovation, markedscyklusser og geopolitik i sin publikation 'The Eurasian Century'.