Cybersikkerhed

Hvordan falske data beskytter rigtige brugere: Værdien af syntetiske data

mm
Føj Securities.io til dine foretrukne kilder på Google
Oplysning: Securities.io kan modtage betaling, når du bruger links til produkter, vi anmelder. Det påvirker ikke vores redaktionelle vurderinger. Vi er ikke registreret investeringsrådgiver; dette er ikke investeringsrådgivning. Læs vores affiliateoplysning.

Den uendelige tørst efter mere data

Efterhånden som verden blev mere digitaliseret, begyndte den at producere og kræve stigende mængder data. Dette udgør et problem, da disse data ofte er knyttet til rigtige mennesker og rigtige virksomheder, som kan have alvorlige privatlivsbekymringer.

Dette er blevet et endnu større problem med fremkomsten af AI, som ikke kun kan udføre statistisk analyse på datamængder, men også kan gennemgå og analysere datasættet i dybden på alle niveauer, fra en enkelt person til milliarder af numeriske poster.

Data er nu så afgørende for den moderne økonomi, at efterspørgslen efter ægte, høj‑kvalitetsdata er vokset eksponentielt. Samtidig har strengere databeskyttelsesregler og stadigt større AI‑modeller gjort indsamling og mærkning af rigtige data stadig vanskeligere eller upraktisk. – IBM Research

Det er derfor, syntetiske data blev opfundet som en løsning. Disse data efterligner virkelige data, men indeholder ingen private oplysninger, der kan skabe problemer. De kan også modificeres og tilpasses specifikke anvendelsestilfælde, sjældne situationer eller alt, hvad statistikeren eller testeren har brug for.

Her også har AI været transformerende. På den ene side er AI‑teknologi meget nyttig til at generere bedre syntetiske data, der går ud over de tidligere rent statistiske metoder. På den anden side er syntetiske data lige så nyttige til at træne AI‑modeller, fra simulerede 3D‑modeller af proteiner til drug discovery til gader for selvkørende AI.

Forklaring af syntetisk AI

Syntetiske data refererer til datasæt, der kunstigt genereres, men bevarer de underliggende statistiske egenskaber fra de originale data, de er baseret på.

Syntetiske data fungerer som et supplement til virkelige data og giver nogle nøglefordele, der gør det muligt for forskere og analytikere at udvide de indledende resultater indsamlet fra undersøgelser, eksperimenter og målinger:

  • Træning af AI‑modeller med syntetiske data gør det muligt at øge den samlede datamængde, når høj‑kvalitets virkelige data er knappe.
  • I sektorer som finans og sundhedspleje er data i begrænset udbud, tidskrævende at indhente eller svære at få adgang til.

Forskningsfirmaet Gartner anslår, at syntetiske data inden 2030 vil overhale faktiske data i træning af AI‑modeller. Gartner forudsiger også, at inden 2026 vil 75 % af virksomheder anvende generativ AI til at skabe syntetiske kundedata.

Typer af syntetiske data

Partielt syntetiske data bruger virkelige datasæt og erstatter dele af dem med kunstige værdier. Dette gøres typisk af hensyn til privatliv og anvendes ofte i klinisk forskning, hvor patienters rigtige identiteter og medicinske journaler anonymiseres.

Fuldt syntetiske data er et fuldstændigt genereret datasæt, der estimerer karakteristika fra virkelige data og forsøger at efterligne dem så præcist som muligt: attributter, mønstre og relationer. Dette kan for eksempel bruges til at træne mod manglende data i et brugerdatasæt, såsom finansielle data uden svigaktiviteter, som er nødvendige for at træne en AI til svigdetektion.

Hybrid syntetiske data kombinerer virkelige data med fuldt syntetiske data.

Hvordan man genererer syntetiske data

Statistiske metoder er med langt den ældste metode til at generere syntetiske data, der går tilbage til 1930’erne med syntese af lyd og stemme, hvilket førte til software‑synthesizere fra 1970’erne og frem.

Variationale autoencodere (VAEs) er programmer, der producerer variationer af de data, de er trænet på. Disse systemer bruges ofte til at generere syntetiske billeder samt andre former for maskinlæring.

Kilde: IBM


Jonathan er en tidligere biokemisk forsker, der arbejdede med genetisk analyse og kliniske forsøg. Han er nu aktieanalytiker og finansskribent med fokus på innovation, markedscyklusser og geopolitik i sin publikation 'The Eurasian Century'.