Siber Güvenlik
Sahte Veriler Gerçek Kullanıcıları Nasıl Korur: Sentetik Verilerin Değeri

Daha Fazla Veri İçin Sonsuz Susuzluk
As the world became more digitized, it started producing and requiring increasing amounts of data. This poses a problem, as said data is often associated with real people and real companies that might have serious privacy concerns.
Bu, dünyanın daha dijital hale gelmesiyle birlikte, daha fazla veri üretmeye ve talep etmeye başlamasıyla ortaya çıktı. Bu durum bir sorun teşkil ediyor, çünkü bu veriler genellikle gerçek insanlar ve gerçek şirketlerle ilişkilidir ve ciddi gizlilik endişelerine yol açabilir.
This has become an even bigger issue with the emergence of AI, which is able not just to do statistical analysis on batches of data but also to comb through and analyze the dataset in-depth at all levels, from an individual person to billions of numerical entries.
AI’nın ortaya çıkmasıyla bu sorun daha da büyüdü; AI yalnızca veri toplulukları üzerinde istatistiksel analiz yapmakla kalmaz, aynı zamanda veri setini bireysel kişiden milyarlarca sayısal girdiye kadar tüm seviyelerde derinlemesine tarayabilir ve analiz edebilir.
Data is now so essential to the modern economy that demand for real, high-quality data has grown exponentially. At the same time, stricter data privacy rules and ever-larger AI models have made gathering and labeling real data increasingly difficult or impractical. – IBM Research
Veri artık modern ekonomi için o kadar hayati ki, gerçek, yüksek kaliteli verilere olan talep katlanarak artmıştır. Aynı zamanda, daha katı veri gizliliği kuralları ve giderek daha büyük AI modelleri, gerçek verileri toplama ve etiketleme sürecini giderek daha zor ve pratik olmayan bir hâle getirmiştir. – IBM Research
This is why synthetic data was invented as a solution. Those data replicate real-world data but do not contain any private data that could cause issues. They also can be modified and adapted to specific use cases, rare situations, or anything the statistician or tester using them might need.
Bu yüzden sentetik veri bir çözüm olarak icat edildi. Bu veriler gerçek dünya verilerini taklit eder ancak sorun yaratabilecek hiçbir özel veri içermez. Ayrıca belirli kullanım senaryolarına, nadir durumlara ya da istatistikçi ya da test eden kişinin ihtiyaç duyabileceği her şeye göre değiştirilebilir ve uyarlanabilir.
Here too, AI has been transformative. On one side AI technology is very useful to generate better synthetic data, going beyond the previous purely statistical methods used until now. On the other side, synthetic data are equally useful to train AI models, from simulated 3D models of proteins for drug discovery to streets for self-driving AI.
AI burada da dönüştürücü bir rol oynamıştır. Bir yandan AI teknolojisi, önceki yalnızca istatistiksel yöntemlerin ötesine geçerek daha iyi sentetik veriler üretmek için çok faydalıdır. Diğer yandan, sentetik veriler, ilaç keşfi için proteinlerin 3D modellerinden otonom sürüş AI’sı için sokak simülasyonlarına kadar AI modellerini eğitmek için eşit derecede faydalıdır.
Sentetik AI Açıklaması
Synthetic data refers to datasets that are artificially generated but retain the underlying statistical properties of the original data on which it is based.
Sentetik veri, yapay olarak oluşturulmuş ancak dayandığı orijinal verinin temel istatistiksel özelliklerini koruyan veri setlerini ifade eder.
Synthetic data acts as a complement to real‑world data and provides a few key advantages that allow researchers and analysts to expand on initial result collected from surveys, experiments, and measurements:
Sentetik veri, gerçek dünya verilerine bir tamamlayıcı olarak hizmet eder ve araştırmacıların ve analistlerin anketler, deneyler ve ölçümlerden elde edilen ilk sonuçları genişletmelerine olanak tanıyan birkaç temel avantaj sunar:
- Training AI models with synthetic data allows us to increase the overall volume of data when high‑quality real data are in short supply.
- In sectors like finance and healthcare, data is in limited supply, time‑consuming to obtain, or difficult to access.
- Sentetik veriyle AI modellerini eğitmek, yüksek kaliteli gerçek verilerin kıt olduğu durumlarda veri hacmini artırmamıza olanak tanır.
- Finans ve sağlık gibi sektörlerde veri sınırlı, elde edilmesi zaman alıcı ya da erişilmesi zordur.
The research firm Gartner estimates that by 2030, synthetic data will overtake actual data in training AI models. Gartner also predicts that by 2026, 75% of businesses will employ generative AI to create synthetic customer data by 2026
Gartner araştırma firması, 2030’a kadar sentetik verinin AI modellerinin eğitiminde gerçek verileri geçeceğini tahmin ediyor. Gartner ayrıca 2026’ya kadar işletmelerin %75’inin sentetik müşteri verileri oluşturmak için üretken AI kullanacağını öngörüyor
Sentetik Veri Türleri
Partially synthetic data uses real‑world datasets and replaces portions of it with artificial value. This is usually done for privacy concerns and is commonly used in clinical research, where the real identities of patients and medical records are anonymized.
Partially synthetic data gerçek dünya veri setlerini kullanır ve bunların bir kısmını yapay değerlerle değiştirir. Bu genellikle gizlilik endişeleri nedeniyle yapılır ve hastaların gerçek kimlikleri ile tıbbi kayıtların anonimleştirildiği klinik araştırmalarda yaygın olarak kullanılır.
Fully synthetic data is an entirely generated dataset, estimating the characteristics of real data and trying to emulate them as well as possible: attributes, patterns, and relationships. This can be, for example, done for training against data missing from a user dataset, like financial data missing fraudulent activities, which are needed to train an AI for fraud detection.
Fully synthetic data tamamen üretilmiş bir veri setidir; gerçek verilerin özelliklerini tahmin eder ve mümkün olduğunca iyi taklit etmeye çalışır: nitelikler, kalıplar ve ilişkiler. Örneğin, bir kullanıcı veri setinde eksik olan finansal verilerde sahtecilik faaliyetleri gibi eksik verileri tamamlamak ve sahtecilik tespiti için bir AI eğitmek amacıyla kullanılabilir.
Hybrid synthetic data combines real data with fully synthetic data.
Hybrid synthetic data gerçek verileri tamamen sentetik verilerle birleştirir.
Sentetik Veri Nasıl Oluşturulur
Statistical methods are by far the oldest method to generate synthetic data, dating back to the 1930s with the synthesis of audio and voice, leading to software synthesizers from the 1970s onwards.
İstatistiksel yöntemler sentetik veri üretmenin en eski yöntemidir; 1930’larda ses ve ses senteziyle başlayan bu yöntem, 1970’lerden itibaren yazılım sentezleyicilerine yol açtı.
Variational autoencoders (VAEs) are programs that produce variations on the data they are trained on. These systems are often used to generate synthetic images, as well as other forms of machine learning.
Variational autoencoders (VAEs) eğitildikleri veriler üzerinde varyasyonlar üreten programlardır. Bu sistemler genellikle sentetik görüntüler ve diğer makine öğrenimi biçimlerini üretmek için kullanılır.

Source: IBM

Kaynak: IBM
A related approach to VAEs is generative adversarial networks (GANs), a major approach to generative artificial intelligence. It is made of two neural networks:
VAEs’e ilgili bir yaklaşım generative adversarial networks (GANs)’dir; bu, üretken yapay zekanın temel yaklaşımlarından biridir. İki sinir ağı içerir:
- One generates data that tries to look like the real data set.
- Another one compares the generated data to a real data set.
- Birincisi, gerçek veri setine benzemeye çalışan veri üretir.
- İkincisi, üretilen veriyi gerçek veri setiyle karşılaştırır.
The second neural network gives feedback to the first one until the first one is able to generate a synthetic dataset as close as possible to the real one.
İkinci sinir ağı, birincisinin gerçek veri setine mümkün olduğunca yakın bir sentetik veri seti üretebilene kadar geribildirim verir.

Source: Wikipedia

Kaynak: Wikipedia
Transformer models use the mathematical tools used in the development of many modern AIs, including ChatGPT (where “T” stands for “transformer). They “guess” the most statistically probable output sequence by focusing on the most important tokens in the input sequence.
Transformer modeller ChatGPT gibi birçok modern AI’nın geliştirilmesinde kullanılan matematiksel araçları kullanır (“T”, “transformer” anlamına gelir). Girdi dizisindeki en önemli token’lara odaklanarak en istatistiksel olarak olası çıktı dizisini “tahmin eder”.
Lastly, agent‑based modeling goes one step further and creates “agents”, mini‑AIs that simulate interactions and agent behaviors to produce synthetic data. For example, individual agents can represent individual people in an epidemiology study, with each displaying its own pattern or rate of contact, infection risk, etc.
Son olarak, agent‑tabanlı modelleme bir adım daha ileri giderek “ajanlar”, yani etkileşimleri ve ajan davranışlarını simüle eden mini‑AI’lar oluşturur ve sentetik veri üretir. Örneğin, bireysel ajanlar bir epidemiyoloji çalışmasında bireysel insanları temsil edebilir; her biri kendi temas, enfeksiyon riski vb. desenini gösterir.
(We explored the future role of AI agents in the workplace and daily life in “AI’s Killer App: How AI Agents Could Change Everything”)
(İş yerinde ve günlük hayatta AI ajanlarının gelecekteki rolünü “AI’s Killer App: How AI Agents Could Change Everything” başlıklı makalemizde inceledik.)
Sentetik Veri Avantajları
Kontrol ve Özelleştirme
Because the data are created from scratch, it is a lot easier to produce the correct set of data for a given task, for example, training an AI system.
Veriler sıfırdan oluşturulduğu için, örneğin bir AI sistemini eğitmek gibi belirli bir görev için doğru veri setini üretmek çok daha kolaydır.
They can also be created to the exact specifications and needs of a business or researcher.
Ayrıca bir işletmenin ya da araştırmacının tam gereksinimlerine ve spesifikasyonlarına göre oluşturulabilirler.
Verimlilik
The generation of data removes the need for expensive and time‑consuming collection of real data, at least as long as the generated synthetic data are close enough to data from the real world.
Veri üretimi, gerçek verilerin pahalı ve zaman alıcı toplanmasına gerek kalmaz; yeterince gerçek dünyaya yakın sentetik veriler üretildiği sürece.
This data also comes prelabeled, which removes the tedious manual step of labeling every data point by a human, describing each image, sentence, or audio file so that an automated system can understand them.
Bu veriler ayrıca önceden etiketlenmiş olarak gelir; bu da her bir görüntüyü, cümleyi ya da ses dosyasını bir insanın tanımlamasını gerektiren zahmetli manuel adımı ortadan kaldırır ve otomatik sistemlerin bunları anlamasını sağlar.
Gizlilik
Fully synthetic data have no privacy‑related issues at all, as they are not tied to any real‑life individuals or businesses. Other forms of synthetic data are a good way to anonymize and “clean” real data of any protected information, be it individual private data or copyrighted or otherwise protected intellectual properties.
Tamamen sentetik verilerin gizlilikle ilgili hiçbir sorunu yoktur; çünkü gerçek bireyler ya da işletmelerle bağlantılı değildirler. Diğer sentetik veri biçimleri, bireysel özel veriler ya da telif hakkı korumalı ya da başka şekilde korunan fikri mülkiyet gibi korunan bilgileri anonimleştirmenin ve “temizlemenin” iyi bir yoludur.

Source: Mostly AI

Kaynak: Mostly AI
Daha Çeşitli Veri
Too small real‑world datasets can miss edge cases or underrepresented groups. This can be an issue when training AIs, as the resulting model would completely ignore the existence of these cases.
Çok küçük gerçek dünya veri setleri uç durumları ya da az temsil edilen grupları kaçırabilir. Bu, AI’ları eğitirken bir sorun olabilir; çünkü ortaya çıkan model bu durumların varlığını tamamen göz ardı eder.
By expanding the initial dataset and artificially adding the missing case the designer knows should exist, the resulting hybrid synthetic data can be more accurate and representative of real situations.
Başlangıç veri setini genişleterek ve tasarımcının var olması gerektiğini bildiği eksik durumu yapay olarak ekleyerek, ortaya çıkan hibrit sentetik veri daha doğru ve gerçek durumları temsil eder hâle gelebilir.
Sentetik Veri Sınırlamaları
Veri Kaybı
Even if, ideally, synthetic data are virtually identical to real data, some level of information can be lost in the process. This is especially true with strong anonymization. So, a balance between privacy and efficiency must sometimes be found.
İdeal olarak sentetik veriler gerçek verilere neredeyse aynı olsa bile, süreçte bazı bilgi seviyeleri kaybolabilir. Bu, özellikle güçlü anonimleştirme durumunda geçerlidir. Bu yüzden gizlilik ve verimlilik arasında bir denge bazen bulunmalıdır.
Önyargı
As synthetic data tries hard to replicate real‑world datasets, they are also likely to replicate any error, bias, or problem found in them. So it is often important to mix multiple real‑life datasets from different regions, demographic groups, time frames, etc, when creating synthetic data.
Sentetik veri gerçek dünya veri setlerini taklit etmeye çalıştığı için, içerdikleri hataları, önyargıları ya da problemleri de çoğaltma ihtimali yüksektir. Bu yüzden sentetik veri oluştururken farklı bölgeler, demografik gruplar, zaman dilimleri vb. çeşitli gerçek yaşam veri setlerini birleştirmek genellikle önemlidir.
“The fidelity of synthetic data is calculated by comparing it to real‑world data through statistical and analytical tests. This includes an assessment of how well the synthetic data preserves key statistical properties, such as means, variances, and correlations between variables.”
Raul Salles de Padua – Director of Engineering, AI and Quantum at Multiverse Computing
“Sentetik verinin sadakati, istatistiksel ve analitik testlerle gerçek dünya verileriyle karşılaştırılarak hesaplanır. Bu, sentetik verinin ortalamalar, varyanslar ve değişkenler arasındaki korelasyonlar gibi temel istatistiksel özellikleri ne kadar iyi koruduğunun değerlendirilmesini içerir.”
Raul Salles de Padua – Director of Engineering, AI and Quantum at Multiverse Computing
Model Çöküşü
AI training can fail when it starts to train on too much of its own output. More training from AI‑generated data creates declining quality, which becomes the input of the next cycle of training, leading to the “degeneration” of the AI model and its collapse.
AI eğitimi, kendi çıktısının çok fazlası üzerinde eğitim almaya başladığında başarısız olabilir. AI‑tarafından üretilen verilerle daha fazla eğitim, kalitenin düşmesine yol açar; bu da bir sonraki eğitim döngüsünün girdisi olur ve AI modelinin “bozulmasına” ve çökmesine neden olur.
For this reason, mixing real data with synthetic data is generally recommended.
Bu nedenle, gerçek verileri sentetik verilerle karıştırmak genellikle önerilir.
“Training on samples from another generative model can induce a distribution shift, which—over time—causes model collapse. This in turn causes the model to misperceive the underlying learning task.
To sustain learning over a long period of time, we need to make sure that access to the original data source is preserved and that further data not generated by LLMs remain available over time.”
AI models collapse when trained on recursively generated data – Nature.
“Başka bir üretken modelin örnekleri üzerinde eğitim, dağılım kayması yaratabilir; bu da zamanla model çöküşüne yol açar. Bu da modelin temel öğrenme görevini yanlış algılamasına neden olur.
Uzun bir süre boyunca öğrenmeyi sürdürmek için, orijinal veri kaynağına erişimin korunmasını ve LLM’ler tarafından üretilmeyen ek verilerin zaman içinde kullanılabilir olmasını sağlamamız gerekir.”
AI models collapse when trained on recursively generated data – Nature.
Sentetik Veri Kullanım Alanları
Otonom Sürüş
As real‑life data of city streets can be difficult to collect in a sufficient number, most self‑driving AI companies are using synthetic data to some extent. These simulated streets, complete with life‑like bicycles, cars, walkers, and random moving objects, can help train the self‑driving AI with many more hours of virtual experience, decreasing the overall cost of the training.
Şehir sokaklarının gerçek yaşam verileri yeterli sayıda toplamak zor olabildiği için, çoğu otonom sürüş AI şirketi bir ölçüde sentetik veri kullanmaktadır. Gerçekçi bisikletler, arabalar, yürüyenler ve rastgele hareket eden nesnelerle dolu bu simüle edilmiş sokaklar, otonom AI’yı çok daha fazla sanal deneyimle eğitmeye yardımcı olur ve eğitim maliyetini azaltır.
Finans
From predictive models for investment and risks (trading, banks, insurance) to fraud detection, finance companies use synthetic data for better detection of risks, fraud, and money laundering.
Yatırım ve risk (ticaret, bankalar, sigorta) için öngörü modellerinden sahtecilik tespitine kadar, finans şirketleri risk, sahtecilik ve kara para aklamayı daha iyi tespit etmek için sentetik veri kullanır.
Here, the use case is not only to properly detect these risks but also for the companies’ management teams to demonstrate to regulators and stakeholders that every effort is being made to detect and avoid these issues, potentially preventing billions in losses or fines.
Burada kullanım senaryosu yalnızca bu riskleri doğru bir şekilde tespit etmekle kalmaz, aynı zamanda şirket yönetim ekiplerinin düzenleyicilere ve paydaşlara bu sorunları tespit etmek ve önlemek için her türlü çabanın gösterildiğini kanıtlamasını sağlar; bu da milyarlarca dolarlık kayıp ya da cezayı önleyebilir.
Sağlık
By increasing the total “experience” of an AI in training, synthetic data can help to train models later used in epidemiology, medical image & lab result analysis, or clinical trials.
AI’nın eğitimdeki toplam “deneyimini” artırarak, sentetik veri epidemiyoloji, tıbbi görüntü ve laboratuvar sonuç analizi ya da klinik deneylerde kullanılacak modellerin eğitilmesine yardımcı olabilir.
Such AIs can later be retroactively tested on known cohorts and population studies, proving the accuracy of their prediction.
Bu AI’lar daha sonra bilinen kohortlar ve nüfus çalışmaları üzerinde geriye dönük olarak test edilebilir; bu da tahminlerinin doğruluğunu kanıtlar.
Sentetik Veri Sağlayıcı – Tonic.ai
Most companies using synthetic data tend to rely on external providers who specialize in this field.
Sentetik veri kullanan çoğu şirket, bu alanda uzmanlaşmış dış sağlayıcılara güvenme eğilimindedir.
One example of this is Tonic.ai, which can integrate with virtually every database, allowing for data mining, development, and testing using the client’s own real data.
Tonic.ai, neredeyse her veritabanı ile bütünleşebilen ve müşterinin kendi gerçek verilerini kullanarak veri madenciliği, geliştirme ve test yapmaya olanak tanıyan bir örnektir.

Source: Tonic.ai

Kaynak: Tonic.ai
Among the services proposed by the company can be mentioned:
Şirketin sunduğu hizmetler arasında şunlar yer alır:
- Creation of isolated test database in seconds.
- Validation of the generated synthetic data.
- Free‑text data redaction and synthesis, ensuring de‑identification.
- Saniyeler içinde izole test veritabanı oluşturma.
- Oluşturulan sentetik verinin doğrulanması.
- Serbest metin veri redaksiyonu ve sentezi, kimlik gizliliğini sağlar.

Source: Tonic.ai

Kaynak: Tonic.ai
Tonic.ai tools are used by many large corporations, such as eBay developers, American Express (AXP ) (see below), Volvo, Cigna, Walgreens, etc.
Tonic.ai araçları, eBay geliştiricileri gibi birçok büyük şirket tarafından kullanılmaktadır, eBay geliştiricileri gibi, American Express (aşağıda), Volvo, Cigna, Walgreens vb.
Sentetik Veri Kullanıcısı – American Express
AXP Fiyat Grafiği
One of the world’s leading credit card providers, American Express, has been at the forefront of utilizing synthetic data for business purposes, already using deep learning before 2020 and using Nvidia (NVDA ) hardware.
Dünyanın önde gelen kredi kartı sağlayıcılarından biri olan American Express, iş amaçlı sentetik veri kullanımının öncüsü konumunda; 2020’den önce derin öğrenme kullanıyordu ve Nvidia donanımı kullanıyor.
Müşteriler İçin AI Kullanımları
Notably, it was reported to use “AI‑generated fake fraud patterns to sharpen its models’ ability to detect rare or uncommon swindles”.
Özellikle, “AI tarafından oluşturulan sahte sahtecilik kalıplarını, modellerinin nadir ya da alışılmadık dolandırıcılıkları tespit etme yeteneğini artırmak için kullandığı” bildirildi.
“These techniques have a substantial impact on the customer experience, allowing American Express to improve the speed of detection and prevent losses by automating the decision‑making process.”
Dmitry Efimov – vice president of machine learning research at American Express
“Bu teknikler müşteri deneyimi üzerinde önemli bir etki yaratmakta, American Express’in tespit hızını artırmasına ve karar verme sürecini otomatikleştirerek kayıpları önlemesine olanak tanımaktadır.”
Dmitry Efimov – American Express’te makine öğrenimi araştırma başkan yardımcısı
It also uses AI and synthetic data for streamlining credit risk assessment by including even social behavior and real‑time market conditions.
Ayrıca sosyal davranış ve gerçek zamanlı piyasa koşullarını da dahil ederek kredi risk değerlendirmesini kolaylaştırmak için AI ve sentetik veri kullanıyor.
It is also used, especially with generative AI, for improving customer services and reducing the times when the company’s chatbot proves insufficient to answer customers’ requests.
Özellikle üretken AI ile, müşteri hizmetlerini iyileştirmek ve şirketin sohbet botunun müşterilerin taleplerine yanıt veremediği durumları azaltmak için de kullanılmaktadır.
Meanwhile, AI algorithms analyze customers’ spending behaviors, preferences, and transaction histories to suggest tailored offers and rewards.
Bu arada, AI algoritmaları müşterilerin harcama davranışlarını, tercihlerini ve işlem geçmişlerini analiz ederek kişiselleştirilmiş teklifler ve ödüller önerir.
İç AI Kullanımları
Internally, AI has allowed American Express to reduce escalation to IT tickets through a reactive problem‑solving system, and the company’s 9,000 engineers now use GitHub Copilot for coding assistance.
İçeride, AI, American Express’in reaktif bir sorun çözme sistemi sayesinde IT biletlerine yönlendirmeyi azaltmasını sağladı ve şirketin 9.000 mühendisi artık kodlama yardımı için GitHub Copilot kullanıyor.
It also helps the 5,000 travel counselors advising the firm’s most elite Centurion (black) card and Platinum card members.
Ayrıca, firmanın en elit Centurion (siyah) kart ve Platinum kart üyelerine danışmanlık yapan 5.000 seyahat danışmanına yardımcı oluyor.
“Travel counselors get stretched across a lot of different areas. For instance, one customer may be asking about must‑visit sites in Barcelona, while the next is enquiring about Buenos Aires’ five‑star restaurants. It’s trying to keep all that in somebody’s head, right?”
Hilary Packer, Amex EVP and CTO
“Seyahat danışmanları birçok farklı alanda görev yapıyor. Örneğin, bir müşteri Barselona’da mutlaka görülmesi gereken yerleri sorarken, bir sonraki Buenos Aires’in beş yıldızlı restoranları hakkında bilgi istiyor. Bütün bunları birinin aklında tutmaya çalışıyor, değil mi?”
Hilary Packer, Amex EVP ve CTO
American Express Genel Bakış
Besides AI and synthetic data, American Express is a solid financial company, expecting a growth of revenues by 8‑10% in 2025, in line with the long‑term goal for revenue growth, and earnings per share by 12‑16%.
AI ve sentetik verinin yanı sıra, American Express sağlam bir finans şirketidir; 2025 yılında gelirlerinde %8‑10, hisse başına kazançta ise %12‑16 artış beklemektedir; bu, uzun vadeli gelir artışı hedefiyle uyumludur.
The company is also quickly expanding internationally, after a long period of mostly being present in the US market, with 15% growth year‑to‑year in international card services billed business.
Şirket, uzun bir süre ABD pazarında ağırlıklı olarak bulunmasının ardından, uluslararası alanda da hızlı bir şekilde genişlemektedir; uluslararası kart hizmetleri işinde yıllık %15 büyüme kaydetmektedir.












