Kyberturvallisuus
Kuinka väärä data suojaa todellisia käyttäjiä: Synteettisen datan arvo

Miksi dataa tarvitaan yhä enemmän
Digitaaliset palvelut ja tekoälymallit tarvitsevat suuria tietoaineistoja. Todelliset aineistot voivat kuitenkin sisältää ihmisten henkilökohtaisia, terveydellisiä tai yritysten luottamuksellisia tietoja. Niiden kerääminen, merkitseminen ja turvallinen jakaminen vie aikaa ja vaatii resursseja.
Synteettinen data tuotetaan keinotekoisesti siten, että se jäljittelee todellisen datan hyödyllisiä ominaisuuksia ja riippuvuuksia. Sillä voidaan täydentää pieniä opetusaineistoja, testata järjestelmiä ja simuloida harvinaisia tapahtumia. Tekoälyä voidaan käyttää datan luomiseen, ja luotua dataa voidaan puolestaan käyttää tekoälyn opettamiseen ja arviointiin.
Mitä synteettinen data tarkoittaa?
Synteettinen aineisto ei ole vain kopio alkuperäisistä tietueista. Se tuotetaan tilastollisilla menetelmillä tai malleilla, jotka pyrkivät säilyttämään esimerkiksi jakaumat, korrelaatiot ja muut tehtävän kannalta olennaiset piirteet. Se voi auttaa aloilla, joilla todellista dataa on vaikea saada käyttöön, kuten terveydenhuollossa ja rahoituspalveluissa. Datan soveltuvuus on silti arvioitava käyttötarkoitus kerrallaan.
Osittain synteettinen, täysin synteettinen ja yhdistelmädata
Osittain synteettisessä aineistossa osa todellisista arvoista korvataan luoduilla arvoilla, usein tunnistamisriskin pienentämiseksi. Täysin synteettinen aineisto koostuu uusista tietueista, joiden on tarkoitus jäljitellä alkuperäisen aineiston tilastollisia suhteita. Yhdistelmäaineisto sisältää sekä aitoja että synteettisiä tietoja. Mikään näistä ratkaisuista ei itsessään takaa anonymiteettiä: tiedon vuotamisen ja uudelleentunnistamisen riski on testattava.
Miten synteettistä dataa tuotetaan?
Perinteiset tilastolliset menetelmät tuottavat havaintoja arvioiduista jakaumista. Variaatioautoenkooderit (VAE) oppivat aineiston esityksen ja luovat uusia muunnelmia. Generatiivisissa kilpailevissa verkoissa (GAN) yksi neuroverkko tuottaa esimerkkejä ja toinen arvioi, kuinka paljon ne muistuttavat opetusaineistoa. Transformer-mallit voivat tuottaa esimerkiksi tietojonoja. Agenttipohjaisissa simulaatioissa mallinnetaan yksilöiden tai muiden toimijoiden käyttäytymistä ja niiden välisiä vuorovaikutuksia.
Menetelmän valintaan vaikuttaa aineiston muoto: kyse voi olla tapahtumataulukosta, kuvasta, tekstistä tai simuloidusta ympäristöstä. Luominen on vasta ensimmäinen vaihe. Tuloksia on verrattava sopivaan todelliseen aineistoon ja kokeiltava siinä tehtävässä, johon niitä aiotaan käyttää.
Mahdolliset hyödyt
Hallinta ja räätälöinti
Aineiston laatija voi määrittää tilanteita ja harvinaisia tapauksia, joita pienessä todellisessa otoksessa ei esiinny. Näin voidaan tutkia mallin toimintaa olosuhteissa, joita olisi vaikea tai vaarallista toistaa käytännössä.
Nopeus ja yksityisyys
Hyvin tuotettu ja merkitty synteettinen aineisto voi vähentää todellisen datan keräämiseen ja käsin merkitsemiseen liittyvää työtä. Se voi myös pienentää tarvetta jakaa arkaluonteisia tietueita. Generatiivinen malli voi kuitenkin muistaa opetusaineistonsa yksityiskohtia ja paljastaa niitä. Yksityisyyden suoja on todennettava erikseen.
Harvinaisten tapausten kattavuus
Esimerkkien tarkoituksellinen lisääminen voi parantaa aliedustettujen tilanteiden näkyvyyttä opetusaineistossa. Tästä on hyötyä vain, jos luodut tapaukset ovat uskottavia eivätkä lisää virheellisiä kuvioita.
Rajoitukset ja laadun arviointi
Synteettiseen aineistoon siirryttäessä voi kadota ennustamisen kannalta tärkeää tietoa. Alkuperäisen aineiston vinoumat voivat myös kopioitua tai vahvistua. Laadunarvioinnissa on tarkasteltava tilastollista vastaavuutta, mallin toimintaa varsinaisessa tehtävässä, eri ryhmien kattavuutta ja yksityisyysriskejä.
Jos malleja opetetaan yhä uudelleen pelkästään muiden generatiivisten mallien tuottamalla datalla, niiden tuotoksen laatu voi heikentyä. Tätä kutsutaan mallin romahtamiseksi. Luotettavan todellisen datan saatavuus on siksi tärkeää; synteettinen data toimii yleensä sen täydentäjänä.
Käyttökohteita
Itseajavat ajoneuvot
Simuloiduilla kaduilla voidaan harjoitella harvinaisia tai vaarallisia tilanteita, joissa on jalankulkijoita, pyöräilijöitä ja muita ajoneuvoja. Järjestelmän toiminta on silti vahvistettava myös todellisissa olosuhteissa.
Rahoituspalvelut
Pankit ja maksupalvelut voivat simuloida epäilyttäviä tapahtumia tai harvinaisia petostapoja riskien havaitsemisen testaamiseksi. Menetelmän arvo riippuu siitä, vastaavatko luodut tapaukset todellisia uhkia ja kuinka paljon turhia hälytyksiä syntyy.
Terveydenhuolto ja tutkimus
Synteettiset kuvat, laboratoriotulokset ja epidemiologiset simulaatiot voivat auttaa mallien kehittämisessä ja alustavassa testaamisessa. Kliininen tarkkuus ja turvallisuus on kuitenkin arvioitava erikseen soveltuvalla todellisella aineistolla.
Yritysesimerkkejä
Tonic.ai tarjoaa työkaluja synteettisten aineistojen luomiseen ja tarkistamiseen, esimerkiksi testitietokantoihin ja arkaluonteisen tekstin peittämiseen. Yrityksen tuotteiden mainitseminen ei tarkoita, että jokainen niiden tuottama aineisto olisi riippumattomasti todettu turvalliseksi.
American Express (AXP ) on kertonut käyttävänsä tekoälyä muun muassa petosten havaitsemiseen, riskien arviointiin ja asiakaspalveluun. Harvinaisten petosmallien simulointi voi auttaa opetusaineiston täydentämisessä, mutta liiketoiminnalliset hyödyt on arvioitava todellisilla tuloksilla. Yhtiö käyttää tekoälytyökaluja myös sisäisissä prosesseissa ja ohjelmistokehityksessä.
AXP Hintakaavio
Synteettinen data voi suojata oikeita käyttäjiä, jos se on riittävän laadukasta, turvallista ja testattu aiottua käyttöä varten. Suoja syntyy huolellisesta suunnittelusta ja tarkistuksesta, ei pelkästä ”synteettinen”-nimityksestä.











