Cibersegurança
Como Dados Falsos Protegem Usuários Reais: O Valor dos Dados Sintéticos

A Sede Infinita por Mais Dados
À medida que o mundo se tornou mais digitalizado, passou a produzir e exigir quantidades cada vez maiores de dados. Isso representa um problema, pois esses dados costumam estar associados a pessoas reais e empresas reais, o que pode gerar sérias preocupações de privacidade.
Isso se tornou ainda mais problemático com o surgimento da IA, que não apenas realiza análises estatísticas em lotes de dados, mas também examina e analisa o conjunto de dados em profundidade em todos os níveis, desde uma pessoa individual até bilhões de entradas numéricas.
Os dados são agora tão essenciais para a economia moderna que a demanda por dados reais e de alta qualidade cresceu exponencialmente. Ao mesmo tempo, regras de privacidade de dados mais rigorosas e modelos de IA cada vez maiores tornaram a coleta e rotulagem de dados reais cada vez mais difíceis ou impraticáveis. – IBM Research
É por isso que os dados sintéticos foram criados como solução. Esses dados replicam dados do mundo real, mas não contêm informações privadas que possam causar problemas. Eles também podem ser modificados e adaptados a casos de uso específicos, situações raras ou qualquer necessidade do estatístico ou testador que os utiliza.
Aqui também, a IA tem sido transformadora. Por um lado, a tecnologia de IA é muito útil para gerar dados sintéticos melhores, indo além dos métodos puramente estatísticos usados até agora. Por outro lado, os dados sintéticos são igualmente úteis para treinar modelos de IA, desde modelos 3D simulados de proteínas para descoberta de medicamentos até ruas para IA de condução autônoma.
IA Sintética Explicada
Dados sintéticos referem‑se a conjuntos de dados gerados artificialmente, mas que mantêm as propriedades estatísticas subjacentes dos dados originais nos quais se baseiam.
Os dados sintéticos funcionam como um complemento aos dados do mundo real e oferecem algumas vantagens principais que permitem a pesquisadores e analistas expandir os resultados iniciais coletados de pesquisas, experimentos e medições:
- Treinar modelos de IA com dados sintéticos permite aumentar o volume total de dados quando dados reais de alta qualidade são escassos.
- Em setores como finanças e saúde, os dados são de oferta limitada, demoram a ser obtidos ou são difíceis de acessar.
A empresa de pesquisa Gartner estima que até 2030, os dados sintéticos superarão os dados reais no treinamento de modelos de IA. Gartner também prevê que até 2026, 75% das empresas usarão IA generativa para criar dados sintéticos de clientes até 2026
Tipos de Dados Sintéticos
Dados sintéticos parcialmente utilizam conjuntos de dados do mundo real e substituem partes deles por valores artificiais. Isso geralmente é feito por questões de privacidade e é comumente usado em pesquisas clínicas, onde as identidades reais de pacientes e registros médicos são anonimados.
Dados sintéticos totalmente são um conjunto de dados totalmente gerado, estimando as características dos dados reais e tentando emulá‑los o melhor possível: atributos, padrões e relacionamentos. Isso pode ser, por exemplo, feito para treinar contra dados ausentes de um conjunto de usuários, como dados financeiros que não contêm atividades fraudulentas, necessárias para treinar uma IA de detecção de fraudes.
Dados sintéticos híbridos combinam dados reais com dados sintéticos totalmente gerados.
Como Gerar Dados Sintéticos
Métodos estatísticos são de longe o método mais antigo para gerar dados sintéticos, remontando à década de 1930 com a síntese de áudio e voz, levando a sintetizadores de software a partir da década de 1970.
Variational autoencoders (VAEs) são programas que produzem variações dos dados nos quais são treinados. Esses sistemas são frequentemente usados para gerar imagens sintéticas, bem como outras formas de aprendizado de máquina.

Fonte: IBM
Uma abordagem relacionada aos VAEs é generative adversarial networks (GANs), uma abordagem importante para inteligência artificial generativa. Ela é composta por duas redes neurais:
- Uma gera dados que tentam se assemelhar ao conjunto de dados real.
- Outra compara os dados gerados a um conjunto de dados real.
A segunda rede neural fornece feedback à primeira até que esta consiga gerar um conjunto de dados sintético o mais próximo possível do real.

Fonte: Wikipedia
Modelos transformer utilizam as ferramentas matemáticas usadas no desenvolvimento de muitas IAs modernas, incluindo o ChatGPT (onde “T” significa “transformer”). Eles “adivinham” a sequência de saída mais estatisticamente provável, focando nos tokens mais importantes da sequência de entrada.
Por fim, modelagem baseada em agentes avança um passo além e cria “agentes”, mini‑IAs que simulam interações e comportamentos de agentes para produzir dados sintéticos. Por exemplo, agentes individuais podem representar pessoas individuais em um estudo epidemiológico, cada um exibindo seu próprio padrão ou taxa de contato, risco de infecção, etc.
(Exploramos o futuro papel dos agentes de IA no local de trabalho e na vida cotidiana em “Aplicativo Mortal da IA: Como os Agentes de IA Podem Mudar Tudo”)
Vantagens dos Dados Sintéticos
Controle e Personalização
Como os dados são criados do zero, é muito mais fácil produzir o conjunto correto de dados para uma tarefa específica, por exemplo, treinar um sistema de IA.
Eles também podem ser criados de acordo com as especificações e necessidades exatas de uma empresa ou pesquisador.
Eficiência
A geração de dados elimina a necessidade de coleta cara e demorada de dados reais, pelo menos enquanto os dados sintéticos gerados forem suficientemente próximos dos dados do mundo real.
Esses dados também vêm pré‑rotulados, o que elimina a etapa manual e tediosa de rotular cada ponto de dados por um humano, descrevendo cada imagem, frase ou arquivo de áudio para que um sistema automatizado possa entendê‑los.
Privacidade
Dados sintéticos totalmente gerados não apresentam nenhum problema relacionado à privacidade, pois não estão vinculados a indivíduos ou empresas reais. Outras formas de dados sintéticos são uma boa maneira de anonimizar e “limpar” dados reais de qualquer informação protegida, seja dados privados individuais ou propriedade intelectual protegida por direitos autorais ou de outra forma.

Fonte: Mostly AI
Dados Mais Diversos
Conjuntos de dados do mundo real muito pequenos podem perder casos extremos ou grupos subrepresentados. Isso pode ser um problema ao treinar IAs, pois o modelo resultante ignoraria completamente a existência desses casos.
Ao expandir o conjunto de dados inicial e adicionar artificialmente o caso ausente que o designer sabe que deve existir, os dados sintéticos híbridos resultantes podem ser mais precisos e representativos de situações reais.
Limitações dos Dados Sintéticos
Perda de Dados
Mesmo que, idealmente, os dados sintéticos sejam virtualmente idênticos aos dados reais, algum nível de informação pode ser perdido no processo. Isso é especialmente verdadeiro com anonimização forte. Portanto, às vezes é necessário encontrar um equilíbrio entre privacidade e eficiência.
Viés
Como os dados sintéticos se esforçam para replicar conjuntos de dados do mundo real, eles também tendem a replicar quaisquer erros, vieses ou problemas encontrados neles. Portanto, costuma ser importante combinar múltiplos conjuntos de dados reais de diferentes regiões, grupos demográficos, períodos de tempo, etc., ao criar dados sintéticos.
“A fidelidade dos dados sintéticos é calculada comparando-os com dados do mundo real por meio de testes estatísticos e analíticos. Isso inclui uma avaliação de quão bem os dados sintéticos preservam propriedades estatísticas chave, como médias, variâncias e correlações entre variáveis.
Raul Salles de Padua – Director of Engineering, AI and Quantum at Multiverse Computing
Colapso de Modelo
O treinamento de IA pode falhar quando começa a treinar demais com sua própria saída. Mais treinamento com dados gerados por IA cria qualidade decrescente, que se torna a entrada do próximo ciclo de treinamento, levando à “degeneração” do modelo de IA e ao seu colapso.
Por esse motivo, a mistura de dados reais com dados sintéticos é geralmente recomendada.
“Treinar com amostras de outro modelo generativo pode induzir uma mudança de distribuição, que—com o tempo—causa o colapso do modelo. Isso, por sua vez, faz com que o modelo perceba erroneamente a tarefa de aprendizado subjacente.
Para manter o aprendizado por um longo período, precisamos garantir que o acesso à fonte de dados original seja preservado e que dados adicionais não gerados por LLMs permaneçam disponíveis ao longo do tempo.
Modelos de IA colapsam quando treinados com dados gerados recursivamente – Nature.
Casos de Uso de Dados Sintéticos
Condução Autônoma
Como os dados da vida real de ruas de cidades podem ser difíceis de coletar em número suficiente, a maioria das empresas de IA de condução autônoma utiliza dados sintéticos em certa medida. Essas ruas simuladas, completas com bicicletas, carros, pedestres e objetos em movimento aleatórios que parecem reais, podem ajudar a treinar a IA de condução autônoma com muitas mais horas de experiência virtual, reduzindo o custo total do treinamento.
Finanças
Desde modelos preditivos para investimento e riscos (negociação, bancos, seguros) até detecção de fraudes, as empresas financeiras utilizam dados sintéticos para melhorar a detecção de riscos, fraudes e lavagem de dinheiro.
Nesse caso, o objetivo não é apenas detectar adequadamente esses riscos, mas também permitir que as equipes de gestão das empresas demonstrem aos reguladores e partes interessadas que todos os esforços estão sendo feitos para detectar e evitar esses problemas, potencialmente prevenindo bilhões em perdas ou multas.
Saúde
Ao aumentar a “experiência” total de uma IA durante o treinamento, os dados sintéticos podem ajudar a treinar modelos posteriormente usados em epidemiologia, análise de imagens médicas e resultados de laboratório, ou ensaios clínicos.
Essas IAs podem ser posteriormente testadas retroativamente em coortes conhecidas e estudos populacionais, comprovando a precisão de suas previsões.
Fornecedor de Dados Sintéticos – Tonic.ai
A maioria das empresas que utilizam dados sintéticos tende a depender de provedores externos especializados nessa área.
Um exemplo disso é a Tonic.ai, que pode integrar-se virtualmente a todos os bancos de dados, permitindo mineração de dados, desenvolvimento e testes usando os próprios dados reais do cliente.

Fonte: Tonic.ai
- Criação de banco de dados de teste isolado em segundos.
- Validação dos dados sintéticos gerados.
- Redação e síntese de dados em texto livre, garantindo a desidentificação.

Fonte: Tonic.ai
As ferramentas da Tonic.ai são usadas por muitas grandes corporações, como desenvolvedores do eBay, American Express (AXP ) (veja abaixo), Volvo, Cigna, Walgreens, etc.
Usuário de Dados Sintéticos – American Express
AXP Gráfico de preços
Um dos principais provedores de cartões de crédito do mundo, a American Express, tem estado na vanguarda da utilização de dados sintéticos para fins empresariais, já usando deep learning antes de 2020 e utilizando hardware da Nvidia (NVDA ).
Usos de IA para Clientes
Notavelmente, foi relatado que utiliza \”padrões falsos de fraude gerados por IA para aprimorar a capacidade de seus modelos de detectar golpes raros ou incomuns\”.
“Essas técnicas têm um impacto substancial na experiência do cliente, permitindo que a American Express melhore a velocidade de detecção e previna perdas automatizando o processo de tomada de decisão.”Dmitry Efimov – vice‑presidente de pesquisa em aprendizado de máquina na American Express
Ela também usa IA e dados sintéticos para agilizar a avaliação de risco de crédito, incluindo até comportamento social e condições de mercado em tempo real.
Também é usado, especialmente com IA generativa, para melhorar os serviços ao cliente e reduzir as vezes em que o chatbot da empresa se mostra insuficiente para responder às solicitações dos clientes.
Entretanto, algoritmos de IA analisam os comportamentos de gasto, preferências e históricos de transações dos clientes para sugerir ofertas e recompensas personalizadas.
Usos Internos de IA
Internamente, a IA permitiu que a American Express reduzisse a escalada de tickets de TI por meio de um sistema reativo de resolução de problemas, e os 9.000 engenheiros da empresa agora utilizam o GitHub Copilot para assistência de codificação.
Também ajuda os 5.000 consultores de viagens que assessoram os membros mais elite dos cartões Centurion (preto) e Platinum da empresa.
“Os consultores de viagens são distribuídos por muitas áreas diferentes. Por exemplo, um cliente pode estar perguntando sobre os locais imperdíveis em Barcelona, enquanto outro está consultando os restaurantes cinco estrelas de Buenos Aires. É tentar manter tudo isso na cabeça de alguém, certo?”Hilary Packer, EVP e CTO da Amex
Visão Geral da American Express
Além de IA e dados sintéticos, a American Express é uma empresa financeira sólida, esperando um crescimento de receitas de 8‑10% em 2025, em linha com a meta de longo prazo para crescimento de receita, e lucro por ação de 12‑16%.
A empresa também está expandindo rapidamente internacionalmente, após um longo período de presença principalmente no mercado dos EUA, com crescimento de 15% ano a ano nos serviços de cartões internacionais faturados.












