Kyberturvallisuus

Kuinka väärä data suojaa todellisia käyttäjiä: Synteettisen datan arvo

mm
Lisää Securities.io suosikkilähteisiisi Google-palvelussa
Ilmoitus: Securities.io voi saada korvauksen, kun käytät arvioimiemme tuotteiden linkkejä. Tämä ei vaikuta toimituksellisiin arvioihimme. Emme ole rekisteröity sijoitusneuvoja; tämä ei ole sijoitusneuvontaa. Lue kumppanuusilmoituksemme.

Miksi dataa tarvitaan yhä enemmän

Digitaaliset palvelut ja tekoälymallit tarvitsevat suuria tietoaineistoja. Todelliset aineistot voivat kuitenkin sisältää ihmisten henkilökohtaisia, terveydellisiä tai yritysten luottamuksellisia tietoja. Niiden kerääminen, merkitseminen ja turvallinen jakaminen vie aikaa ja vaatii resursseja.

Synteettinen data tuotetaan keinotekoisesti siten, että se jäljittelee todellisen datan hyödyllisiä ominaisuuksia ja riippuvuuksia. Sillä voidaan täydentää pieniä opetusaineistoja, testata järjestelmiä ja simuloida harvinaisia tapahtumia. Tekoälyä voidaan käyttää datan luomiseen, ja luotua dataa voidaan puolestaan käyttää tekoälyn opettamiseen ja arviointiin.

Mitä synteettinen data tarkoittaa?

Synteettinen aineisto ei ole vain kopio alkuperäisistä tietueista. Se tuotetaan tilastollisilla menetelmillä tai malleilla, jotka pyrkivät säilyttämään esimerkiksi jakaumat, korrelaatiot ja muut tehtävän kannalta olennaiset piirteet. Se voi auttaa aloilla, joilla todellista dataa on vaikea saada käyttöön, kuten terveydenhuollossa ja rahoituspalveluissa. Datan soveltuvuus on silti arvioitava käyttötarkoitus kerrallaan.

Osittain synteettinen, täysin synteettinen ja yhdistelmädata

Osittain synteettisessä aineistossa osa todellisista arvoista korvataan luoduilla arvoilla, usein tunnistamisriskin pienentämiseksi. Täysin synteettinen aineisto koostuu uusista tietueista, joiden on tarkoitus jäljitellä alkuperäisen aineiston tilastollisia suhteita. Yhdistelmäaineisto sisältää sekä aitoja että synteettisiä tietoja. Mikään näistä ratkaisuista ei itsessään takaa anonymiteettiä: tiedon vuotamisen ja uudelleentunnistamisen riski on testattava.

Miten synteettistä dataa tuotetaan?

Perinteiset tilastolliset menetelmät tuottavat havaintoja arvioiduista jakaumista. Variaatioautoenkooderit (VAE) oppivat aineiston esityksen ja luovat uusia muunnelmia. Generatiivisissa kilpailevissa verkoissa (GAN) yksi neuroverkko tuottaa esimerkkejä ja toinen arvioi, kuinka paljon ne muistuttavat opetusaineistoa. Transformer-mallit voivat tuottaa esimerkiksi tietojonoja. Agenttipohjaisissa simulaatioissa mallinnetaan yksilöiden tai muiden toimijoiden käyttäytymistä ja niiden välisiä vuorovaikutuksia.

Menetelmän valintaan vaikuttaa aineiston muoto: kyse voi olla tapahtumataulukosta, kuvasta, tekstistä tai simuloidusta ympäristöstä. Luominen on vasta ensimmäinen vaihe. Tuloksia on verrattava sopivaan todelliseen aineistoon ja kokeiltava siinä tehtävässä, johon niitä aiotaan käyttää.

Mahdolliset hyödyt

Hallinta ja räätälöinti

Aineiston laatija voi määrittää tilanteita ja harvinaisia tapauksia, joita pienessä todellisessa otoksessa ei esiinny. Näin voidaan tutkia mallin toimintaa olosuhteissa, joita olisi vaikea tai vaarallista toistaa käytännössä.

Nopeus ja yksityisyys

Hyvin tuotettu ja merkitty synteettinen aineisto voi vähentää todellisen datan keräämiseen ja käsin merkitsemiseen liittyvää työtä. Se voi myös pienentää tarvetta jakaa arkaluonteisia tietueita. Generatiivinen malli voi kuitenkin muistaa opetusaineistonsa yksityiskohtia ja paljastaa niitä. Yksityisyyden suoja on todennettava erikseen.

Harvinaisten tapausten kattavuus

Esimerkkien tarkoituksellinen lisääminen voi parantaa aliedustettujen tilanteiden näkyvyyttä opetusaineistossa. Tästä on hyötyä vain, jos luodut tapaukset ovat uskottavia eivätkä lisää virheellisiä kuvioita.

Rajoitukset ja laadun arviointi

Synteettiseen aineistoon siirryttäessä voi kadota ennustamisen kannalta tärkeää tietoa. Alkuperäisen aineiston vinoumat voivat myös kopioitua tai vahvistua. Laadunarvioinnissa on tarkasteltava tilastollista vastaavuutta, mallin toimintaa varsinaisessa tehtävässä, eri ryhmien kattavuutta ja yksityisyysriskejä.

Jos malleja opetetaan yhä uudelleen pelkästään muiden generatiivisten mallien tuottamalla datalla, niiden tuotoksen laatu voi heikentyä. Tätä kutsutaan mallin romahtamiseksi. Luotettavan todellisen datan saatavuus on siksi tärkeää; synteettinen data toimii yleensä sen täydentäjänä.

Käyttökohteita

Itseajavat ajoneuvot

Simuloiduilla kaduilla voidaan harjoitella harvinaisia tai vaarallisia tilanteita, joissa on jalankulkijoita, pyöräilijöitä ja muita ajoneuvoja. Järjestelmän toiminta on silti vahvistettava myös todellisissa olosuhteissa.

Rahoituspalvelut

Pankit ja maksupalvelut voivat simuloida epäilyttäviä tapahtumia tai harvinaisia petostapoja riskien havaitsemisen testaamiseksi. Menetelmän arvo riippuu siitä, vastaavatko luodut tapaukset todellisia uhkia ja kuinka paljon turhia hälytyksiä syntyy.

Terveydenhuolto ja tutkimus

Synteettiset kuvat, laboratoriotulokset ja epidemiologiset simulaatiot voivat auttaa mallien kehittämisessä ja alustavassa testaamisessa. Kliininen tarkkuus ja turvallisuus on kuitenkin arvioitava erikseen soveltuvalla todellisella aineistolla.

Yritysesimerkkejä

Tonic.ai tarjoaa työkaluja synteettisten aineistojen luomiseen ja tarkistamiseen, esimerkiksi testitietokantoihin ja arkaluonteisen tekstin peittämiseen. Yrityksen tuotteiden mainitseminen ei tarkoita, että jokainen niiden tuottama aineisto olisi riippumattomasti todettu turvalliseksi.

American Express (AXP ) on kertonut käyttävänsä tekoälyä muun muassa petosten havaitsemiseen, riskien arviointiin ja asiakaspalveluun. Harvinaisten petosmallien simulointi voi auttaa opetusaineiston täydentämisessä, mutta liiketoiminnalliset hyödyt on arvioitava todellisilla tuloksilla. Yhtiö käyttää tekoälytyökaluja myös sisäisissä prosesseissa ja ohjelmistokehityksessä.

AXP Hintakaavio

Synteettinen data voi suojata oikeita käyttäjiä, jos se on riittävän laadukasta, turvallista ja testattu aiottua käyttöä varten. Suoja syntyy huolellisesta suunnittelusta ja tarkistuksesta, ei pelkästä ”synteettinen”-nimityksestä.

Jonathan on entinen biokemian tutkija, joka on työskennellyt geneettisen analyysin ja kliinisten kokeiden parissa. Hän on nyt osakeanalyytikko ja rahoituskirjoittaja, jonka keskittyminen on innovaatioihin, markkisykleihin ja geopoliittisiin asioihin julkaisussaan 'The Eurasian Century'.