Sicurezza informatica

Come i dati falsi proteggono gli utenti reali: il valore dei dati sintetici

mm
Aggiungi Securities.io alle tue fonti preferite su Google
Informativa: Securities.io può ricevere un compenso quando utilizzi link a prodotti da noi recensiti. Ciò non influenza le nostre valutazioni editoriali. Non siamo un consulente finanziario registrato; queste non sono raccomandazioni di investimento. Leggi la nostra informativa sulle affiliazioni.

Perché servono i dati sintetici

I sistemi digitali e i modelli di intelligenza artificiale richiedono grandi quantità di dati. Quelli reali possono però contenere informazioni personali, segreti commerciali, eventi rari o gruppi poco rappresentati. Raccoglierli, etichettarli e condividerli può essere costoso, lento o vietato.

I dati sintetici sono record creati artificialmente per riprodurre proprietà utili di una popolazione o di un processo. Possono aiutare nello sviluppo e nel collaudo del software, nell’addestramento dei modelli e nella simulazione di scenari difficili da osservare. Non sono una copia perfetta della realtà e non garantiscono automaticamente privacy, equità o accuratezza.

Che cosa sono i dati sintetici

Un set completamente sintetico contiene solo record generati. Un set parzialmente sintetico sostituisce alcune variabili sensibili, mentre un set ibrido combina dati reali e artificiali. La scelta dipende dall’uso: un database di test ha esigenze diverse da uno studio clinico o da un sistema antifrode.

La qualità va misurata su almeno tre dimensioni: utilità per il compito, rischio di divulgazione e fedeltà statistica. Un set può sembrare realistico ma perdere relazioni decisive; può anche preservare troppo fedelmente casi reali rari, aumentando il rischio di reidentificazione.

Come vengono generati

I metodi classici stimano distribuzioni e dipendenze statistiche e poi campionano nuovi record. Gli approcci moderni comprendono autoencoder variazionali, reti generative avversarie, modelli di diffusione, transformer e simulazioni basate su agenti.

Gli autoencoder variazionali comprimono gli esempi in uno spazio latente e generano nuove varianti campionando quello spazio. Sono utili per immagini e dati strutturati, ma possono attenuare dettagli rari o importanti.

Schema di un autoencoder variazionale

Fonte: IBM

Le reti generative avversarie mettono in competizione un generatore e un discriminatore. Possono produrre campioni realistici, ma sono difficili da addestrare e possono omettere parti della distribuzione. Transformer e modelli di diffusione possono gestire testo, immagini o tabelle, ma ereditano limiti e distorsioni dei dati di partenza.

Schema di una rete generativa avversaria

Fonte: Wikipedia

La modellazione ad agenti crea entità simulate che seguono regole e interagiscono. È adatta a traffico, epidemie e mercati, ma i risultati riflettono le ipotesi inserite nel modello. Una simulazione dettagliata non è necessariamente una previsione affidabile.

Vantaggi principali

Controllo e casi rari

Il progettista può aumentare deliberatamente incidenti, frodi, malattie rare o condizioni stradali pericolose che compaiono poco nei dati reali. Questo migliora la copertura dei test, purché gli scenari siano plausibili e non sostituiscano la verifica su dati reali.

Velocità e costi

Una volta costruita la pipeline, è possibile produrre record già etichettati e database di test su richiesta. Si riducono la raccolta manuale e l’accesso ai sistemi di produzione. Restano però i costi per creare, convalidare, aggiornare e governare il generatore.

Privacy

I dati sintetici possono ridurre l’esposizione diretta di persone reali, ma definirli «anonimi» senza test è pericoloso. Un modello può memorizzare record di addestramento, soprattutto quando il campione è piccolo o contiene valori unici. Occorrono valutazioni di membership inference, attribute inference e reidentificazione; quando appropriato, si possono aggiungere tecniche come la privacy differenziale.

Confronto tra approcci di anonimizzazione e sintesi dei dati

Fonte: Mostly AI

Copertura ed equità

La sintesi può riequilibrare gruppi sottorappresentati, ma non crea conoscenza affidabile dal nulla. Se i pochi esempi reali sono distorti o insufficienti, i nuovi campioni possono amplificare l’errore. Prestazioni e tassi di errore vanno misurati separatamente per i gruppi rilevanti.

Limiti e controlli necessari

Perdita di informazione

Più il generatore semplifica o protegge i dati, più può perdere correlazioni, code della distribuzione e dipendenze temporali. La metrica di somiglianza deve corrispondere all’uso finale: una buona media non basta per un sistema che deve riconoscere eventi estremi.

Bias e deriva

Il generatore riproduce spesso i bias del campione originale e può introdurne di nuovi. Inoltre, popolazioni, frodi e comportamenti cambiano nel tempo. La pipeline deve essere monitorata e ricalibrata con dati reali recenti e con una provenienza documentata.

Collasso del modello

Uno studio pubblicato su Nature nel 2024 ha mostrato che l’addestramento ricorsivo e indiscriminato sui risultati di modelli precedenti può causare il collasso del modello: le code scompaiono e la distribuzione appresa perde varietà. Lo studio non dimostra che ogni uso di dati sintetici sia dannoso. Indica che bisogna conservare l’accesso a dati originali e curati, tracciare la provenienza e miscelare i campioni in modo controllato.

Casi d’uso

Guida autonoma

Le simulazioni espongono i veicoli virtuali a milioni di combinazioni di strade, meteo, pedoni e guasti senza creare pericolo. Devono però essere confrontate con sensori e test reali, perché il divario tra simulazione e mondo fisico può nascondere materiali, riflessi o comportamenti imprevisti.

Finanza

Banche e assicurazioni usano dati sintetici per testare software, addestrare sistemi antifrode e simulare stress. I casi rari possono essere aumentati, ma un modello costruito su frodi inventate può imparare segnali che i criminali reali non producono. Validazione temporale, audit e controllo normativo restano necessari.

Sanità

I dati sintetici possono facilitare la condivisione e bilanciare coorti piccole in imaging, epidemiologia e ricerca clinica. Non sostituiscono il consenso, la governance o la validazione prospettica. Un modello clinico deve essere testato su pazienti reali rappresentativi prima dell’uso assistenziale.

Un fornitore: Tonic.ai

Tonic.ai offre strumenti per generare database di sviluppo, mascherare o sintetizzare dati strutturati, creare ambienti temporanei e trattare testo libero. L’integrazione con database esistenti può aiutare i team a evitare copie non controllate dei sistemi di produzione.

Flusso di sincronizzazione e generazione di un database di test

Fonte: Tonic.ai

Trattamento di testo libero in una piattaforma di dati sintetici

Fonte: Tonic.ai

L’adozione di un fornitore non trasferisce la responsabilità. L’impresa deve verificare accessi, crittografia, localizzazione, cancellazione, contratti, metriche di privacy e capacità di ricostruire la provenienza dei dati.

Un utilizzatore: American Express

AXP Grafico dei prezzi

American Express (AXP ) usa da anni apprendimento automatico in aree come prevenzione delle frodi, assistenza e operazioni. I dati sintetici possono aumentare gli esempi di frodi rare e consentire test senza esporre direttamente tutte le transazioni reali.

La loro utilità dipende dalla corrispondenza con gli attacchi correnti. I truffatori cambiano strategia quando un controllo diventa comune, perciò il sistema deve apprendere anche da casi reali confermati e deve essere sorvegliato per falsi positivi che possono bloccare clienti legittimi.

Il caso d’investimento

American Express gestisce una rete di pagamenti, emette carte e concede credito. Ciò le offre una visione integrata delle spese e dei rischi, ma la espone anche a perdite su crediti, finanziamento, cicli economici, frodi, sicurezza informatica e regolamentazione delle commissioni.

L’intelligenza artificiale può ridurre costi e migliorare decisioni, ma non costituisce da sola una tesi d’investimento. Gli investitori dovrebbero seguire crescita della spesa fatturata, ricavi al netto degli interessi, accantonamenti, insolvenze, costi dei premi, capitale e valutazione. I precedenti obiettivi annuali riportati nell’articolo erano previsioni riferite a periodi specifici e sono stati rimossi.

La personalizzazione deve inoltre rispettare consenso, minimizzazione dei dati, spiegabilità e norme sul credito. Variabili correlate a caratteristiche protette possono creare discriminazione anche quando tali caratteristiche non sono inserite esplicitamente.

Conclusione

I dati sintetici sono utili quando ampliano scenari rari, riducono l’accesso ai record sensibili e accelerano lo sviluppo. Non sono un sostituto universale dei dati reali e non conferiscono privacy per definizione.

Una pratica solida conserva dati reali curati, misura utilità e rischio di divulgazione, documenta il generatore, testa i sottogruppi e aggiorna il sistema quando il mondo cambia. Questo contenuto è informativo e non costituisce una raccomandazione d’investimento personale.

Ultime notizie su American Express

Jonathan è un ex ricercatore biochimico che ha lavorato nell'analisi genetica e nelle sperimentazioni cliniche. Ora è un analista di titoli e scrittore finanziario con un focus su innovazione, cicli di mercato e geopolitica nella sua pubblicazione 'The Eurasian Century'.