साइबर सुरक्षा
कैसे नकली डेटा वास्तविक उपयोगकर्ताओं की सुरक्षा करता है: सिंथेटिक डेटा का मूल्य

अधिक डेटा की अंतहीन प्यास
जैसे-जैसे दुनिया अधिक डिजिटल होती गई, उसने अधिक मात्रा में डेटा उत्पन्न करना और उसकी आवश्यकता शुरू कर दी। यह एक समस्या पैदा करता है, क्योंकि यह डेटा अक्सर वास्तविक लोगों और कंपनियों से जुड़ा होता है, जिनके गोपनीयता संबंधी गंभीर चिंताएँ हो सकती हैं।
यह मुद्दा AI के उदय के साथ और भी बड़ा हो गया, जो न केवल डेटा के बैचों पर सांख्यिकीय विश्लेषण कर सकता है बल्कि व्यक्तिगत व्यक्ति से लेकर अरबों संख्यात्मक प्रविष्टियों तक सभी स्तरों पर डेटा सेट को गहराई से जांच और विश्लेषण कर सकता है।
डेटा अब आधुनिक अर्थव्यवस्था के लिए इतना आवश्यक हो गया है कि वास्तविक, उच्च-गुणवत्ता वाले डेटा की मांग घातीय रूप से बढ़ गई है। साथ ही, कड़े डेटा गोपनीयता नियम और लगातार बड़े होते AI मॉडल वास्तविक डेटा एकत्र करने और लेबल करने को अधिक कठिन या व्यावहारिक रूप से असंभव बना रहे हैं। – IBM Research
इसीलिए सिंथेटिक डेटा को एक समाधान के रूप में आविष्कार किया गया। ये डेटा वास्तविक दुनिया के डेटा की नकल करते हैं लेकिन इनमें कोई निजी डेटा नहीं होता जो समस्याएँ पैदा कर सके। इन्हें विशिष्ट उपयोग मामलों, दुर्लभ स्थितियों, या किसी भी चीज़ के अनुसार संशोधित और अनुकूलित किया जा सकता है जिसकी आवश्यकता डेटा वैज्ञानिक या परीक्षक को हो।
यहाँ भी, AI ने परिवर्तनकारी भूमिका निभाई है। एक ओर AI तकनीक बेहतर सिंथेटिक डेटा उत्पन्न करने में बहुत उपयोगी है, जो अब तक उपयोग की गई शुद्ध सांख्यिकीय विधियों से आगे है। दूसरी ओर, सिंथेटिक डेटा AI मॉडलों को प्रशिक्षित करने में समान रूप से उपयोगी हैं, जैसे दवा खोज के लिए प्रोटीन के 3D मॉडल से लेकर स्व-ड्राइविंग AI के लिए सड़कों तक।
सिंथेटिक एआई समझाया गया
सिंथेटिक डेटा उन डेटासेट को कहा जाता है जो कृत्रिम रूप से उत्पन्न होते हैं लेकिन जिनमें मूल डेटा की अंतर्निहित सांख्यिकीय विशेषताएँ बनी रहती हैं, जिन पर वे आधारित होते हैं।
सिंथेटिक डेटा वास्तविक‑विश्व डेटा का पूरक है और कुछ प्रमुख लाभ प्रदान करता है जो शोधकर्ताओं और विश्लेषकों को सर्वेक्षण, प्रयोग और माप से एकत्रित प्रारंभिक परिणामों का विस्तार करने की अनुमति देते हैं:
- सिंथेटिक डेटा के साथ AI मॉडल प्रशिक्षण करने से हम कुल डेटा की मात्रा बढ़ा सकते हैं जब उच्च‑गुणवत्ता वाले वास्तविक डेटा की कमी हो।
- वित्त और स्वास्थ्य‑सेवा जैसे क्षेत्रों में डेटा सीमित, प्राप्त करने में समय‑साध्य या पहुँचने में कठिन होता है।
The research firm Gartner estimates that by 2030, synthetic data will overtake actual data in training AI models. Gartner also predicts that by 2026, 75% of businesses will employ generative AI to create synthetic customer data by 2026
सिंथेटिक डेटा के प्रकार
Partially synthetic data वास्तविक‑विश्व डेटासेट का उपयोग करता है और उसके कुछ हिस्सों को कृत्रिम मानों से बदल देता है। यह आमतौर पर गोपनीयता कारणों से किया जाता है और क्लिनिकल रिसर्च में व्यापक रूप से उपयोग होता है, जहाँ रोगियों की वास्तविक पहचान और मेडिकल रिकॉर्ड को अनाम किया जाता है।
Fully synthetic data पूरी तरह से उत्पन्न डेटासेट है, जो वास्तविक डेटा की विशेषताओं का अनुमान लगाकर उन्हें यथासंभव सटीक रूप से अनुकरण करने का प्रयास करता है: गुण, पैटर्न और संबंध। उदाहरण के लिए, यह उपयोगकर्ता डेटासेट में अनुपलब्ध वित्तीय डेटा, जैसे धोखाधड़ी गतिविधियों की कमी, को भरने के लिए किया जा सकता है, जो धोखाधड़ी पहचान AI को प्रशिक्षित करने के लिए आवश्यक है।
Hybrid synthetic data वास्तविक डेटा को पूरी तरह से सिंथेटिक डेटा के साथ मिलाता है।
सिंथेटिक डेटा कैसे उत्पन्न करें
Statistical methods सबसे पुरानी विधि है सिंथेटिक डेटा उत्पन्न करने की, जो 1930 के दशक में ऑडियो और आवाज़ के संश्लेषण से शुरू हुई, और 1970 के दशक से सॉफ़्टवेयर सिंथेसाइज़र तक पहुँची।
Variational autoencoders (VAEs) ऐसे प्रोग्राम हैं जो उन डेटा में विविधताएँ उत्पन्न करते हैं जिन पर उन्हें प्रशिक्षित किया गया है। इन सिस्टमों का अक्सर सिंथेटिक छवियों के साथ-साथ अन्य मशीन‑लर्निंग रूपों को उत्पन्न करने में उपयोग किया जाता है।

स्रोत: IBM
VAEs के एक संबंधित दृष्टिकोण को generative adversarial networks (GANs) कहा जाता है, जो जनरेटिव आर्टिफिशियल इंटेलिजेंस की प्रमुख विधि है। यह दो न्यूरल नेटवर्कों से बना होता है:
- एक डेटा उत्पन्न करता है जो वास्तविक डेटा सेट जैसा दिखने की कोशिश करता है।
- दूसरा उत्पन्न डेटा की वास्तविक डेटा सेट से तुलना करता है।
दूसरा न्यूरल नेटवर्क पहले को प्रतिक्रिया देता रहता है जब तक कि पहला वास्तविक डेटा के जितना संभव हो सके उतना निकट सिंथेटिक डेटासेट उत्पन्न न कर ले।

स्रोत: Wikipedia
Transformer models उन गणितीय उपकरणों का उपयोग करते हैं जो कई आधुनिक AI, जिसमें ChatGPT भी शामिल है (जहाँ “T” का अर्थ “transformer” है), के विकास में उपयोग होते हैं। वे इनपुट अनुक्रम में सबसे महत्वपूर्ण टोकन पर ध्यान केंद्रित करके सबसे सांख्यिकीय रूप से संभावित आउटपुट अनुक्रम “अनुमान” लगाते हैं।
अंत में, agent-based modeling एक कदम आगे जाता है और “एजेंट” बनाता है, छोटे‑AI जो इंटरैक्शन और एजेंट व्यवहारों का सिमुलेशन करके सिंथेटिक डेटा उत्पन्न करते हैं। उदाहरण के लिए, व्यक्तिगत एजेंट महामारी अध्ययन में व्यक्तिगत लोगों का प्रतिनिधित्व कर सकते हैं, जहाँ प्रत्येक अपना संपर्क, संक्रमण जोखिम आदि का पैटर्न दिखाता है।
(We explored the future role of AI agents in the workplace and daily life in “AI’s Killer App: How AI Agents Could Change Everything”)
सिंथेटिक डेटा के लाभ
Control & Customization
चूँकि डेटा शून्य से निर्मित होते हैं, किसी विशिष्ट कार्य, जैसे AI प्रणाली को प्रशिक्षित करने के लिए, सही डेटा सेट बनाना बहुत आसान हो जाता है।
इन्हें व्यवसाय या शोधकर्ता की सटीक विशिष्टताओं और आवश्यकताओं के अनुसार भी बनाया जा सकता है।
Efficiency
डेटा का उत्पादन वास्तविक डेटा एकत्र करने की महँगी और समय‑साध्य प्रक्रिया को समाप्त कर देता है, बशर्ते उत्पन्न सिंथेटिक डेटा वास्तविक दुनिया के डेटा के पर्याप्त निकट हो।
यह डेटा पहले से लेबल किया हुआ भी आता है, जिससे प्रत्येक डेटा बिंदु को मानव द्वारा लेबल करने की थकाऊ मैनुअल प्रक्रिया समाप्त हो जाती है, चाहे वह छवि हो, वाक्य हो या ऑडियो फ़ाइल, ताकि स्वचालित प्रणाली उन्हें समझ सके।
Privacy
पूरी तरह से सिंथेटिक डेटा में कोई भी गोपनीयता‑संबंधी समस्या नहीं होती, क्योंकि वे किसी वास्तविक व्यक्ति या व्यवसाय से जुड़े नहीं होते। अन्य रूप के सिंथेटिक डेटा वास्तविक डेटा को किसी भी संरक्षित जानकारी—व्यक्तिगत निजी डेटा या कॉपीराइटेड या अन्य प्रकार की बौद्धिक संपदा—से “साफ” और अनाम करने का एक अच्छा तरीका हैं।

स्रोत: Mostly AI
More Diverse Data
बहुत छोटे वास्तविक‑विश्व डेटासेट किनारे के मामलों या कम प्रतिनिधित्व वाले समूहों को छोड़ सकते हैं। यह AI प्रशिक्षण में समस्या बन सकता है, क्योंकि resulting मॉडल इन मामलों को पूरी तरह से अनदेखा कर देगा।
प्रारंभिक डेटासेट का विस्तार करके और वह गायब केस कृत्रिम रूप से जोड़कर जिसे डिज़ाइनर मानता है कि मौजूद होना चाहिए, परिणामी हाइब्रिड सिंथेटिक डेटा अधिक सटीक और वास्तविक स्थितियों का प्रतिनिधित्व करने वाला बन सकता है।
सिंथेटिक डेटा की सीमाएँ
Data Loss
भले ही आदर्श रूप में सिंथेटिक डेटा वास्तविक डेटा के लगभग समान हो, प्रक्रिया में कुछ स्तर की जानकारी खो सकती है। यह विशेष रूप से मजबूत अनामिकरण के साथ सच है। इसलिए कभी‑कभी गोपनीयता और दक्षता के बीच संतुलन बनाना आवश्यक हो जाता है।
Bias
चूँकि सिंथेटिक डेटा वास्तविक‑विश्व डेटासेट को दोहराने की कोशिश करता है, यह उनमें मौजूद किसी भी त्रुटि, पक्षपात या समस्या को भी दोहराने की संभावना रखता है। इसलिए सिंथेटिक डेटा बनाते समय विभिन्न क्षेत्रों, जनसांख्यिकीय समूहों, समय‑सीमाओं आदि से कई वास्तविक‑जीवन डेटासेट को मिलाना अक्सर महत्वपूर्ण होता है।
“The fidelity of synthetic data is calculated by comparing it to real-world data through statistical and analytical tests. This includes an assessment of how well the synthetic data preserves key statistical properties, such as means, variances, and correlations between variables.”
Raul Salles de Padua – Director of Engineering, AI and Quantum at Multiverse Computing
Model Collapse
जब AI बहुत अधिक अपने स्वयं के आउटपुट पर प्रशिक्षण करता है तो प्रशिक्षण विफल हो सकता है। AI‑जनित डेटा से अधिक प्रशिक्षण करने से गुणवत्ता घटती है, जो अगले प्रशिक्षण चक्र का इनपुट बनती है, जिससे AI मॉडल “विघटित” हो जाता है और अंततः पतन होता है।
इस कारण, वास्तविक डेटा को सिंथेटिक डेटा के साथ मिलाना आमतौर पर अनुशंसित है।
“Training on samples from another generative model can induce a distribution shift, which—over time—causes model collapse. This in turn causes the model to misperceive the underlying learning task.
To sustain learning over a long period of time, we need to make sure that access to the original data source is preserved and that further data not generated by LLMs remain available over time.”
AI models collapse when trained on recursively generated data – Nature.
सिंथेटिक डेटा उपयोग केस
Self-Driving
चूँकि वास्तविक‑जीवन शहर की सड़कों का डेटा पर्याप्त मात्रा में एकत्र करना कठिन हो सकता है, अधिकांश स्व‑ड्राइविंग AI कंपनियाँ किसी न किसी हद तक सिंथेटिक डेटा का उपयोग करती हैं। ये सिम्युलेटेड सड़कों, जिनमें जीवन‑समान साइकिल, कार, पैदल यात्री और यादृच्छिक चलती वस्तुएँ शामिल हैं, स्व‑ड्राइविंग AI को कई अधिक वर्चुअल घंटे के अनुभव के साथ प्रशिक्षित करने में मदद करती हैं, जिससे प्रशिक्षण की कुल लागत घटती है।
Finance
निवेश और जोखिम (ट्रेडिंग, बैंक, बीमा) के भविष्यवाणी मॉडल से लेकर धोखाधड़ी पहचान तक, वित्तीय कंपनियाँ जोखिम, धोखाधड़ी और मनी लॉन्डरिंग का बेहतर पता लगाने के लिए सिंथेटिक डेटा का उपयोग करती हैं।
यहाँ उपयोग‑केस केवल इन जोखिमों का सही पता लगाने के लिए नहीं है, बल्कि कंपनियों की प्रबंधन टीमों को नियामकों और हितधारकों को यह दिखाने के लिए भी है कि इन मुद्दों का पता लगाने और उनसे बचने के लिए हर संभव प्रयास किया जा रहा है, जिससे संभावित रूप से अरबों नुकसान या जुर्माना रोका जा सकता है।
Healthcare
AI के प्रशिक्षण में कुल “अनुभव” को बढ़ाकर, सिंथेटिक डेटा बाद में महामारी विज्ञान, मेडिकल इमेज & लैब परिणाम विश्लेषण, या क्लिनिकल ट्रायल्स में उपयोग किए जाने वाले मॉडलों को प्रशिक्षित करने में मदद कर सकता है।
ऐसे AI को बाद में ज्ञात समूहों और जनसंख्या अध्ययनों पर पुनः‑परीक्षण किया जा सकता है, जिससे उनकी भविष्यवाणी की सटीकता सिद्ध होती है।
Synthetic Data Provider – Tonic.ai
अधिकांश कंपनियाँ जो सिंथेटिक डेटा का उपयोग करती हैं, वे इस क्षेत्र में विशेषज्ञ बाहरी प्रदाताओं पर निर्भर करती हैं।
इसका एक उदाहरण Tonic.ai है, जो लगभग सभी डेटाबेस के साथ एकीकृत हो सकता है, जिससे क्लाइंट के अपने वास्तविक डेटा का उपयोग करके डेटा माइनिंग, विकास और परीक्षण संभव हो जाता है।

स्रोत: Tonic.ai
कंपनी द्वारा प्रस्तावित सेवाओं में शामिल हैं:
- सेकंडों में अलग‑थलग परीक्षण डेटाबेस का निर्माण।
- उत्पन्न सिंथेटिक डेटा का सत्यापन।
- फ्री‑टेक्स्ट डेटा रिडैक्शन और संश्लेषण, जिससे पहचान‑हटाना सुनिश्चित होता है।

स्रोत: Tonic.ai
Tonic.ai टूल्स कई बड़े निगमों द्वारा उपयोग किए जाते हैं, जैसे eBay डेवलपर्स, American Express (AXP ) (नीचे देखें), Volvo, Cigna, Walgreens, आदि।
Synthetic Data User – American Express
AXP मूल्य चार्ट
विश्व के प्रमुख क्रेडिट कार्ड प्रदाताओं में से एक, American Express, व्यापारिक उद्देश्यों के लिए सिंथेटिक डेटा के उपयोग में अग्रणी रहा है, 2020 से पहले ही डीप लर्निंग का उपयोग कर रहा है और Nvidia (NVDA ) हार्डवेयर का उपयोग करता है।
AI Uses for Customers
विशेष रूप से, यह रिपोर्ट किया गया है कि उन्होंने “AI‑जनित नकली धोखाधड़ी पैटर्न का उपयोग करके अपने मॉडलों की दुर्लभ या असामान्य घोटालों को पहचानने की क्षमता को तेज किया”।
“इन तकनीकों का ग्राहक अनुभव पर महत्वपूर्ण प्रभाव पड़ता है, जिससे American Express तेज़ी से पहचान कर नुकसान को रोक सकता है, क्योंकि निर्णय‑निर्धारण प्रक्रिया को स्वचालित किया जाता है।”
Dmitry Efimov – vice president of machine learning research at American Express
यह AI और सिंथेटिक डेटा का उपयोग क्रेडिट जोखिम मूल्यांकन को सुव्यवस्थित करने के लिए भी करता है, जिसमें सामाजिक व्यवहार और वास्तविक‑समय बाजार स्थितियों को भी शामिल किया जाता है।
यह विशेष रूप से जनरेटिव AI के साथ, ग्राहक सेवाओं को सुधारने और कंपनी के चैटबॉट द्वारा ग्राहक अनुरोधों का उत्तर न देने की स्थितियों को कम करने के लिए उपयोग किया जाता है।
इसी बीच, AI एल्गोरिदम ग्राहकों के खर्च के व्यवहार, प्राथमिकताओं और लेन‑देन इतिहास का विश्लेषण करके व्यक्तिगत ऑफ़र और रिवॉर्ड्स सुझाते हैं।
Internal AI Uses
आंतरिक रूप से, AI ने American Express को IT टिकटों की वृद्धि को कम करने में मदद की है, क्योंकि एक प्रतिक्रियात्मक समस्या‑समाधान प्रणाली लागू की गई है, और कंपनी के 9,000 इंजीनियर अब कोडिंग सहायता के लिए GitHub Copilot का उपयोग करते हैं।
यह 5,000 यात्रा सलाहकारों को भी मदद करता है जो फर्म के सबसे विशिष्ट Centurion (ब्लैक) कार्ड और Platinum कार्ड सदस्यों को सलाह देते हैं।
“यात्रा सलाहकारों को बहुत से अलग-अलग विषय संभालने पड़ते हैं। उदाहरण के लिए, एक ग्राहक बार्सिलोना में घूमने लायक प्रमुख स्थानों के बारे में पूछ सकता है, जबकि अगला ब्यूनस आयर्स के पांच सितारा रेस्तरां की जानकारी चाहता है। इतनी सारी जानकारी किसी एक व्यक्ति के दिमाग में बनाए रखना कठिन है, है न?”
American Express Overview
AI और सिंथेटिक डेटा के अलावा, American Express एक ठोस वित्तीय कंपनी है, जो 2025 में 8‑10% राजस्व वृद्धि की अपेक्षा कर रही है, जो राजस्व वृद्धि के दीर्घकालिक लक्ष्य के अनुरूप है, और प्रति शेयर आय में 12‑16% की वृद्धि की उम्मीद है।
कंपनी अंतरराष्ट्रीय स्तर पर भी तेज़ी से विस्तार कर रही है, एक लंबे समय तक मुख्यतः US बाजार में मौजूद रहने के बाद, अंतरराष्ट्रीय कार्ड सेवाओं के बिल्ड बिज़नेस में वर्ष‑दर‑वर्ष 15% की वृद्धि के साथ।












