Cybersikkerhet

Hvordan falske data beskytter ekte brukere: Verdien av syntetiske data

mm
Legg til Securities.io blant dine foretrukne kilder på Google
Opplysning: Securities.io kan motta betaling når du bruker lenker til produkter vi vurderer. Dette påvirker ikke våre redaksjonelle vurderinger. Vi er ikke en registrert investeringsrådgiver; dette er ikke investeringsråd. Les vår affiliateopplysning.

Den endeløse tørsten etter mer data

Etter hvert som verden ble mer digitalisert, begynte den å produsere og kreve stadig større mengder data. Dette skaper et problem, ettersom disse dataene ofte er knyttet til ekte personer og ekte selskaper som kan ha alvorlige personvernproblemer.

Dette har blitt et enda større problem med fremveksten av AI, som ikke bare kan utføre statistisk analyse på datasett, men også gå gjennom og analysere datasettet i dybden på alle nivåer, fra en enkeltperson til milliarder av numeriske oppføringer.

Data er nå så essensielt for den moderne økonomien at etterspørselen etter ekte, høy‑kvalitetsdata har vokst eksponentielt. Samtidig har strengere personvernregler og stadig større AI‑modeller gjort innsamling og merking av ekte data stadig vanskeligere eller upraktisk. – IBM Research

Dette er grunnen til at syntetiske data ble oppfunnet som en løsning. Disse dataene etterligner virkelige data, men inneholder ingen private opplysninger som kan skape problemer. De kan også endres og tilpasses spesifikke bruksområder, sjeldne situasjoner eller alt statistiker eller tester som bruker dem måtte trenge.
Her også har AI vært transformerende. På den ene siden er AI‑teknologi svært nyttig for å generere bedre syntetiske data, og går utover de tidligere rent statistiske metodene som ble brukt. På den andre siden er syntetiske data like nyttige for å trene AI‑modeller, fra simulerte 3D‑modeller av proteiner for legemiddelforskning til gater for selvkjørende AI.

Syntetisk AI forklart

Syntetiske data refererer til datasett som er kunstig generert, men som beholder de underliggende statistiske egenskapene til de originale dataene de er basert på.
Syntetiske data fungerer som et supplement til virkelige data og gir noen viktige fordeler som gjør det mulig for forskere og analytikere å bygge videre på de innledende resultatene samlet fra undersøkelser, eksperimenter og målinger:

  • Å trene AI‑modeller med syntetiske data gjør det mulig å øke den totale datamengden når høykvalitets ekte data er i knapphet.
  • I sektorer som finans og helsevesen er data i begrenset mengde, tidkrevende å skaffe eller vanskelig å få tilgang til.

Forskningsfirmaet Gartner anslår at syntetiske data innen 2030 vil overgå faktiske data i trening av AI‑modeller. Gartner forutsier også at innen 2026 vil 75 % av bedrifter bruke generativ AI til å lage syntetiske kundedata.

Typer syntetiske data

Delvis syntetiske data bruker virkelige datasett og erstatter deler av dem med kunstige verdier. Dette gjøres vanligvis av personvernhensyn og brukes ofte i klinisk forskning, hvor de ekte identitetene til pasienter og medisinske journaler anonymiseres.

Fullt syntetiske data er et helt generert datasett, som estimerer egenskapene til ekte data og prøver å etterligne dem så godt som mulig: attributter, mønstre og relasjoner. Dette kan for eksempel gjøres for trening mot data som mangler i et brukerdatasett, som finansielle data uten svindelaktiviteter, som er nødvendig for å trene en AI for svindeldeteksjon.

Hybridsyntetiske data kombinerer ekte data med fullt syntetiske data.

Hvordan generere syntetiske data

Statistiske metoder er langt den eldste metoden for å generere syntetiske data, og går tilbake til 1930‑årene med syntese av lyd og tale, som førte til programvare‑syntetisatorer fra 1970‑tallet og fremover.

Variational autoencoders (VAEs) er programmer som produserer variasjoner av dataene de er trent på. Disse systemene brukes ofte til å generere syntetiske bilder, samt andre former for maskinlæring.

Kilde: IBM


En beslektet tilnærming til VAEs er generative adversarial networks (GANs), en viktig tilnærming til generativ kunstig intelligens. Den består av to nevrale nettverk:
  • Den ene genererer data som prøver å ligne på det ekte datasettet.
  • Den andre sammenligner de genererte dataene med et ekte datasett.

Det andre nevrale nettverket gir tilbakemelding til det første til det første er i stand til å generere et syntetisk datasett som er så nært som mulig det ekte.

Kilde: Wikipedia

Transformer-modeller bruker de matematiske verktøyene som brukes i utviklingen av mange moderne AI‑systemer, inkludert ChatGPT (der «T» står for «transformer»). De «gjettet» den mest statistisk sannsynlige utgangssekvensen ved å fokusere på de viktigste tokenene i inndata‑sekvensen.

Til slutt går agentbasert modellering ett steg videre og lager «agenter», mini‑AIer som simulerer interaksjoner og agentatferd for å produsere syntetiske data. For eksempel kan individuelle agenter representere enkeltpersoner i en epidemiologisk studie, hvor hver viser sitt eget mønster eller kontaktfrekvens, infeksjonsrisiko osv.

(Vi utforsket AI‑agentenes fremtidige rolle på arbeidsplassen og i hverdagen i “AI’s Killer App: Hvordan AI‑agenter kan endre alt”)

Fordeler med syntetiske data

Kontroll og tilpasning

Fordi dataene er laget fra bunnen av, er det mye enklere å produsere det riktige datasettet for en gitt oppgave, for eksempel å trene et AI‑system.
De kan også opprettes etter nøyaktige spesifikasjoner og behov for en bedrift eller forsker.

Effektivitet

Generering av data fjerner behovet for dyr og tidkrevende innsamling av ekte data, så lenge de genererte syntetiske dataene er tilstrekkelig like virkelige data.
Disse dataene kommer også forhåndsmerkede, noe som fjerner den tidkrevende manuelle prosessen med å merke hvert datapunkt av en person, ved å beskrive hvert bilde, hver setning eller hver lydfil slik at et automatisert system kan forstå dem.

Personvern

Fullt syntetiske data har ingen personvernrelaterte problemer, da de ikke er knyttet til noen virkelige individer eller virksomheter. Andre former for syntetiske data er en god måte å anonymisere og «rense» ekte data for beskyttet informasjon, enten det er individuelle private data eller opphavsrettslig eller på annen måte beskyttet immateriell eiendom.

Kilde: Mostly AI

Mer mangfoldig data

For små virkelige datasett kan gå glipp av kanttilfeller eller underrepresenterte grupper. Dette kan være et problem ved trening av AI, da den resulterende modellen helt ville ignorere eksistensen av disse tilfellene.
Ved å utvide det opprinnelige datasettet og kunstig legge til det manglende tilfellet som designeren vet bør finnes, kan de resulterende hybride syntetiske dataene bli mer nøyaktige og representere virkelige situasjoner bedre.

Begrensninger ved syntetiske data

Datatap

Selv om syntetiske data i teorien er praktisk talt identiske med ekte data, kan noe informasjon gå tapt i prosessen. Dette gjelder spesielt ved sterk anonymisering. Så en balanse mellom personvern og effektivitet må noen ganger oppnås.

Skjevhet

Ettersom syntetiske data prøver hardt å etterligne virkelige datasett, er de også sannsynlig å replikere eventuelle feil, skjevheter eller problemer som finnes i dem. Derfor er det ofte viktig å blande flere virkelige datasett fra ulike regioner, demografiske grupper, tidsrammer osv. når man lager syntetiske data.

“Nøyaktigheten til syntetiske data beregnes ved å sammenligne dem med virkelige data gjennom statistiske og analytiske tester. Dette inkluderer en vurdering av hvor godt de syntetiske dataene bevarer viktige statistiske egenskaper, som gjennomsnitt, varians og korrelasjoner mellom variabler.”

Raul Salles de Padua – Direktør for engineering, AI og kvante hos Multiverse Computing

Modellkollaps

AI‑trening kan mislykkes når den begynner å trene på for mye av sin egen output. Mer trening på AI‑genererte data fører til synkende kvalitet, som blir input til neste treningssyklus, noe som fører til «degenerasjon» av AI‑modellen og dens kollaps.
Av denne grunn anbefales det generelt å blande ekte data med syntetiske data.

“Trening på prøver fra en annen generativ modell kan indusere et distribusjonsforskyvning, som – over tid – forårsaker modellkollaps. Dette får modellen til å misoppfatte den underliggende læringsoppgaven.

For å opprettholde læring over en lang periode må vi sikre at tilgangen til den opprinnelige datakilden bevares, og at ytterligere data som ikke er generert av LLM‑er forblir tilgjengelige over tid.”

AI‑modeller kollapser når de trenes på rekursivt genererte data – Nature.

Bruksområder for syntetiske data

Selvkjørende

Ettersom virkelige data fra bygater kan være vanskelig å samle i tilstrekkelig mengde, bruker de fleste selvkjørende AI‑selskaper syntetiske data i noen grad. Disse simulerte gatene, komplett med livaktige sykler, biler, fotgjengere og tilfeldige bevegelige objekter, kan hjelpe med å trene den selvkjørende AI‑en med mange flere timer virtuell erfaring, og redusere de totale treningskostnadene.

Finans

Fra prediktive modeller for investering og risiko (handel, banker, forsikring) til svindeldeteksjon, bruker finansselskaper syntetiske data for bedre oppdagelse av risiko, svindel og hvitvasking.
Her er bruksområdet ikke bare å oppdage disse risikoene på riktig måte, men også for selskapenes ledelsesteam å demonstrere for regulatorer og interessenter at alle tiltak blir gjort for å oppdage og unngå disse problemene, noe som potensielt kan forhindre milliarder i tap eller bøter.

Helsevesen

Ved å øke den totale «erfaringen» en AI får under trening, kan syntetiske data hjelpe med å trene modeller som senere brukes i epidemiologi, medisinsk bilde‑ og laboratorieresultat‑analyse, eller kliniske studier.
Slike AI‑er kan senere testes retrospektivt på kjente kohorter og befolkningsstudier, og bevise nøyaktigheten av deres prediksjoner.

Syntetisk dataleverandør – Tonic.ai

De fleste selskaper som bruker syntetiske data, har en tendens til å stole på eksterne leverandører som er spesialiserte på dette feltet.
Et eksempel på dette er Tonic.ai, som kan integreres med praktisk talt alle databaser, og gjør det mulig å utføre datamining, utvikling og testing ved hjelp av kundens egne ekte data.

Kilde: Tonic.ai

Kilde: Tonic.ai

Tonic.ai‑verktøy brukes av mange store selskaper, som eBay‑utviklere, American Express (AXP ) (se nedenfor), Volvo, Cigna, Walgreens osv.

Syntetisk databruker – American Express

AXP Prisdiagram


En av verdens ledende kredittkortleverandører, American Express, har vært i frontlinjen for å bruke syntetiske data til forretningsformål, allerede brukt dyp læring før 2020 og bruker Nvidia (NVDA ) ‑maskinvare.

AI‑bruk for kunder

Det ble spesielt rapportert at de bruker «AI‑genererte falske svindelmønstre for å skjerpe modellens evne til å oppdage sjeldne eller uvanlige svindel».

“Disse teknikkene har en betydelig innvirkning på kundeopplevelsen, og gjør det mulig for American Express å forbedre hastigheten på oppdagelse og forhindre tap ved å automatisere beslutningsprosessen.”
Dmitry Efimov – visepresident for maskinlæringsforskning hos American Express

Den bruker også AI og syntetiske data for å strømlinjeforme kredittvurdering ved å inkludere også sosial atferd og sanntids markedsforhold.
Den brukes også, spesielt med generativ AI, for å forbedre kundeservice og redusere tilfeller der selskapets chatbot er utilstrekkelig til å svare på kunders forespørsler.
Samtidig analyserer AI‑algoritmer kunders forbruksmønstre, preferanser og transaksjonshistorikk for å foreslå skreddersydde tilbud og belønninger.

Interne AI‑bruk

Internt har AI gjort det mulig for American Express å redusere eskalering til IT‑billetter gjennom et reaktivt problemløsningssystem, og selskapets 9 000 ingeniører bruker nå GitHub Copilot for kodeassistanse.
Det hjelper også de 5 000 reiserådgiverne som veileder selskapets mest elite Centurion‑ (svart) kort‑ og Platinum‑kortmedlemmer.

“Reiserådgivere blir strukket over mange ulike områder. For eksempel kan en kunde spørre om must‑see‑steder i Barcelona, mens den neste etterspør femstjerners restauranter i Buenos Aires. Det er som å prøve å holde alt dette i noens hode, ikke sant?”
Hilary Packer, Amex EVP og CTO

Oversikt over American Express

I tillegg til AI og syntetiske data er American Express et solid finansselskap, som forventer en inntektsvekst på 8‑10 % i 2025, i tråd med det langsiktige målet for inntektsvekst, og en inntjening per aksje på 12‑16 %.
Selskapet ekspanderer også raskt internasjonalt, etter en lang periode med hovedsakelig tilstedeværelse i det amerikanske markedet, med 15 % vekst år‑over‑år i internasjonal korttjenestebasert virksomhet.

Siste om American Express

Jonathan er en tidligere biokjemisk forsker som har arbeidet med genetisk analyse og kliniske studier. Han er nå aksjeanalytiker og finansskribent med fokus på innovasjon, markedssykluser og geopolitikk i sin publikasjon 'The Eurasian Century'.⁣⁣⁣​⁣