साइबर सुरक्षा

कैसे नकली डेटा वास्तविक उपयोगकर्ताओं की सुरक्षा करता है: सिंथेटिक डेटा का मूल्य

mm
Securities.io को Google पर अपने पसंदीदा स्रोतों में जोड़ें
प्रकटीकरण: हमारे समीक्षा किए गए उत्पादों के लिंक उपयोग करने पर Securities.io को मुआवज़ा मिल सकता है। इससे हमारे संपादकीय मूल्यांकन प्रभावित नहीं होते। हम पंजीकृत निवेश सलाहकार नहीं हैं; यह निवेश सलाह नहीं है। हमारा सहबद्ध प्रकटीकरण पढ़ें.

अधिक डेटा की अंतहीन प्यास

जैसे-जैसे दुनिया अधिक डिजिटल होती गई, उसने अधिक मात्रा में डेटा उत्पन्न करना और उसकी आवश्यकता शुरू कर दी। यह एक समस्या पैदा करता है, क्योंकि यह डेटा अक्सर वास्तविक लोगों और कंपनियों से जुड़ा होता है, जिनके गोपनीयता संबंधी गंभीर चिंताएँ हो सकती हैं।

यह मुद्दा AI के उदय के साथ और भी बड़ा हो गया, जो न केवल डेटा के बैचों पर सांख्यिकीय विश्लेषण कर सकता है बल्कि व्यक्तिगत व्यक्ति से लेकर अरबों संख्यात्मक प्रविष्टियों तक सभी स्तरों पर डेटा सेट को गहराई से जांच और विश्लेषण कर सकता है।

डेटा अब आधुनिक अर्थव्यवस्था के लिए इतना आवश्यक हो गया है कि वास्तविक, उच्च-गुणवत्ता वाले डेटा की मांग घातीय रूप से बढ़ गई है। साथ ही, कड़े डेटा गोपनीयता नियम और लगातार बड़े होते AI मॉडल वास्तविक डेटा एकत्र करने और लेबल करने को अधिक कठिन या व्यावहारिक रूप से असंभव बना रहे हैं। – IBM Research

इसीलिए सिंथेटिक डेटा को एक समाधान के रूप में आविष्कार किया गया। ये डेटा वास्तविक दुनिया के डेटा की नकल करते हैं लेकिन इनमें कोई निजी डेटा नहीं होता जो समस्याएँ पैदा कर सके। इन्हें विशिष्ट उपयोग मामलों, दुर्लभ स्थितियों, या किसी भी चीज़ के अनुसार संशोधित और अनुकूलित किया जा सकता है जिसकी आवश्यकता डेटा वैज्ञानिक या परीक्षक को हो।

यहाँ भी, AI ने परिवर्तनकारी भूमिका निभाई है। एक ओर AI तकनीक बेहतर सिंथेटिक डेटा उत्पन्न करने में बहुत उपयोगी है, जो अब तक उपयोग की गई शुद्ध सांख्यिकीय विधियों से आगे है। दूसरी ओर, सिंथेटिक डेटा AI मॉडलों को प्रशिक्षित करने में समान रूप से उपयोगी हैं, जैसे दवा खोज के लिए प्रोटीन के 3D मॉडल से लेकर स्व-ड्राइविंग AI के लिए सड़कों तक।

सिंथेटिक एआई समझाया गया

सिंथेटिक डेटा उन डेटासेट को कहा जाता है जो कृत्रिम रूप से उत्पन्न होते हैं लेकिन जिनमें मूल डेटा की अंतर्निहित सांख्यिकीय विशेषताएँ बनी रहती हैं, जिन पर वे आधारित होते हैं।

सिंथेटिक डेटा वास्तविक‑विश्व डेटा का पूरक है और कुछ प्रमुख लाभ प्रदान करता है जो शोधकर्ताओं और विश्लेषकों को सर्वेक्षण, प्रयोग और माप से एकत्रित प्रारंभिक परिणामों का विस्तार करने की अनुमति देते हैं:

  • सिंथेटिक डेटा के साथ AI मॉडल प्रशिक्षण करने से हम कुल डेटा की मात्रा बढ़ा सकते हैं जब उच्च‑गुणवत्ता वाले वास्तविक डेटा की कमी हो।
  • वित्त और स्वास्थ्य‑सेवा जैसे क्षेत्रों में डेटा सीमित, प्राप्त करने में समय‑साध्य या पहुँचने में कठिन होता है।

The research firm Gartner estimates that by 2030, synthetic data will overtake actual data in training AI models. Gartner also predicts that by 2026, 75% of businesses will employ generative AI to create synthetic customer data by 2026

सिंथेटिक डेटा के प्रकार

Partially synthetic data वास्तविक‑विश्व डेटासेट का उपयोग करता है और उसके कुछ हिस्सों को कृत्रिम मानों से बदल देता है। यह आमतौर पर गोपनीयता कारणों से किया जाता है और क्लिनिकल रिसर्च में व्यापक रूप से उपयोग होता है, जहाँ रोगियों की वास्तविक पहचान और मेडिकल रिकॉर्ड को अनाम किया जाता है।

Fully synthetic data पूरी तरह से उत्पन्न डेटासेट है, जो वास्तविक डेटा की विशेषताओं का अनुमान लगाकर उन्हें यथासंभव सटीक रूप से अनुकरण करने का प्रयास करता है: गुण, पैटर्न और संबंध। उदाहरण के लिए, यह उपयोगकर्ता डेटासेट में अनुपलब्ध वित्तीय डेटा, जैसे धोखाधड़ी गतिविधियों की कमी, को भरने के लिए किया जा सकता है, जो धोखाधड़ी पहचान AI को प्रशिक्षित करने के लिए आवश्यक है।

Hybrid synthetic data वास्तविक डेटा को पूरी तरह से सिंथेटिक डेटा के साथ मिलाता है।

सिंथेटिक डेटा कैसे उत्पन्न करें

Statistical methods सबसे पुरानी विधि है सिंथेटिक डेटा उत्पन्न करने की, जो 1930 के दशक में ऑडियो और आवाज़ के संश्लेषण से शुरू हुई, और 1970 के दशक से सॉफ़्टवेयर सिंथेसाइज़र तक पहुँची।

Variational autoencoders (VAEs) ऐसे प्रोग्राम हैं जो उन डेटा में विविधताएँ उत्पन्न करते हैं जिन पर उन्हें प्रशिक्षित किया गया है। इन सिस्टमों का अक्सर सिंथेटिक छवियों के साथ-साथ अन्य मशीन‑लर्निंग रूपों को उत्पन्न करने में उपयोग किया जाता है।

स्रोत: IBM

VAEs के एक संबंधित दृष्टिकोण को generative adversarial networks (GANs) कहा जाता है, जो जनरेटिव आर्टिफिशियल इंटेलिजेंस की प्रमुख विधि है। यह दो न्यूरल नेटवर्कों से बना होता है:

  • एक डेटा उत्पन्न करता है जो वास्तविक डेटा सेट जैसा दिखने की कोशिश करता है।
  • दूसरा उत्पन्न डेटा की वास्तविक डेटा सेट से तुलना करता है।

दूसरा न्यूरल नेटवर्क पहले को प्रतिक्रिया देता रहता है जब तक कि पहला वास्तविक डेटा के जितना संभव हो सके उतना निकट सिंथेटिक डेटासेट उत्पन्न न कर ले।

स्रोत: Wikipedia

Transformer models उन गणितीय उपकरणों का उपयोग करते हैं जो कई आधुनिक AI, जिसमें ChatGPT भी शामिल है (जहाँ “T” का अर्थ “transformer” है), के विकास में उपयोग होते हैं। वे इनपुट अनुक्रम में सबसे महत्वपूर्ण टोकन पर ध्यान केंद्रित करके सबसे सांख्यिकीय रूप से संभावित आउटपुट अनुक्रम “अनुमान” लगाते हैं।

अंत में, agent-based modeling एक कदम आगे जाता है और “एजेंट” बनाता है, छोटे‑AI जो इंटरैक्शन और एजेंट व्यवहारों का सिमुलेशन करके सिंथेटिक डेटा उत्पन्न करते हैं। उदाहरण के लिए, व्यक्तिगत एजेंट महामारी अध्ययन में व्यक्तिगत लोगों का प्रतिनिधित्व कर सकते हैं, जहाँ प्रत्येक अपना संपर्क, संक्रमण जोखिम आदि का पैटर्न दिखाता है।

(We explored the future role of AI agents in the workplace and daily life in “AI’s Killer App: How AI Agents Could Change Everything”)

सिंथेटिक डेटा के लाभ

Control & Customization

चूँकि डेटा शून्य से निर्मित होते हैं, किसी विशिष्ट कार्य, जैसे AI प्रणाली को प्रशिक्षित करने के लिए, सही डेटा सेट बनाना बहुत आसान हो जाता है।

इन्हें व्यवसाय या शोधकर्ता की सटीक विशिष्टताओं और आवश्यकताओं के अनुसार भी बनाया जा सकता है।

Efficiency

डेटा का उत्पादन वास्तविक डेटा एकत्र करने की महँगी और समय‑साध्य प्रक्रिया को समाप्त कर देता है, बशर्ते उत्पन्न सिंथेटिक डेटा वास्तविक दुनिया के डेटा के पर्याप्त निकट हो।

यह डेटा पहले से लेबल किया हुआ भी आता है, जिससे प्रत्येक डेटा बिंदु को मानव द्वारा लेबल करने की थकाऊ मैनुअल प्रक्रिया समाप्त हो जाती है, चाहे वह छवि हो, वाक्य हो या ऑडियो फ़ाइल, ताकि स्वचालित प्रणाली उन्हें समझ सके।

Privacy

पूरी तरह से सिंथेटिक डेटा में कोई भी गोपनीयता‑संबंधी समस्या नहीं होती, क्योंकि वे किसी वास्तविक व्यक्ति या व्यवसाय से जुड़े नहीं होते। अन्य रूप के सिंथेटिक डेटा वास्तविक डेटा को किसी भी संरक्षित जानकारी—व्यक्तिगत निजी डेटा या कॉपीराइटेड या अन्य प्रकार की बौद्धिक संपदा—से “साफ” और अनाम करने का एक अच्छा तरीका हैं।

स्रोत: Mostly AI

More Diverse Data

बहुत छोटे वास्तविक‑विश्व डेटासेट किनारे के मामलों या कम प्रतिनिधित्व वाले समूहों को छोड़ सकते हैं। यह AI प्रशिक्षण में समस्या बन सकता है, क्योंकि resulting मॉडल इन मामलों को पूरी तरह से अनदेखा कर देगा।

प्रारंभिक डेटासेट का विस्तार करके और वह गायब केस कृत्रिम रूप से जोड़कर जिसे डिज़ाइनर मानता है कि मौजूद होना चाहिए, परिणामी हाइब्रिड सिंथेटिक डेटा अधिक सटीक और वास्तविक स्थितियों का प्रतिनिधित्व करने वाला बन सकता है।

सिंथेटिक डेटा की सीमाएँ

Data Loss

भले ही आदर्श रूप में सिंथेटिक डेटा वास्तविक डेटा के लगभग समान हो, प्रक्रिया में कुछ स्तर की जानकारी खो सकती है। यह विशेष रूप से मजबूत अनामिकरण के साथ सच है। इसलिए कभी‑कभी गोपनीयता और दक्षता के बीच संतुलन बनाना आवश्यक हो जाता है।

Bias

चूँकि सिंथेटिक डेटा वास्तविक‑विश्व डेटासेट को दोहराने की कोशिश करता है, यह उनमें मौजूद किसी भी त्रुटि, पक्षपात या समस्या को भी दोहराने की संभावना रखता है। इसलिए सिंथेटिक डेटा बनाते समय विभिन्न क्षेत्रों, जनसांख्यिकीय समूहों, समय‑सीमाओं आदि से कई वास्तविक‑जीवन डेटासेट को मिलाना अक्सर महत्वपूर्ण होता है।

“The fidelity of synthetic data is calculated by comparing it to real-world data through statistical and analytical tests. This includes an assessment of how well the synthetic data preserves key statistical properties, such as means, variances, and correlations between variables.”

Raul Salles de Padua – Director of Engineering, AI and Quantum at Multiverse Computing

Model Collapse

जब AI बहुत अधिक अपने स्वयं के आउटपुट पर प्रशिक्षण करता है तो प्रशिक्षण विफल हो सकता है। AI‑जनित डेटा से अधिक प्रशिक्षण करने से गुणवत्ता घटती है, जो अगले प्रशिक्षण चक्र का इनपुट बनती है, जिससे AI मॉडल “विघटित” हो जाता है और अंततः पतन होता है।

इस कारण, वास्तविक डेटा को सिंथेटिक डेटा के साथ मिलाना आमतौर पर अनुशंसित है।

“Training on samples from another generative model can induce a distribution shift, which—over time—causes model collapse. This in turn causes the model to misperceive the underlying learning task.

To sustain learning over a long period of time, we need to make sure that access to the original data source is preserved and that further data not generated by LLMs remain available over time.”

AI models collapse when trained on recursively generated data – Nature.

सिंथेटिक डेटा उपयोग केस

Self-Driving

चूँकि वास्तविक‑जीवन शहर की सड़कों का डेटा पर्याप्त मात्रा में एकत्र करना कठिन हो सकता है, अधिकांश स्व‑ड्राइविंग AI कंपनियाँ किसी न किसी हद तक सिंथेटिक डेटा का उपयोग करती हैं। ये सिम्युलेटेड सड़कों, जिनमें जीवन‑समान साइकिल, कार, पैदल यात्री और यादृच्छिक चलती वस्तुएँ शामिल हैं, स्व‑ड्राइविंग AI को कई अधिक वर्चुअल घंटे के अनुभव के साथ प्रशिक्षित करने में मदद करती हैं, जिससे प्रशिक्षण की कुल लागत घटती है।

Finance

निवेश और जोखिम (ट्रेडिंग, बैंक, बीमा) के भविष्यवाणी मॉडल से लेकर धोखाधड़ी पहचान तक, वित्तीय कंपनियाँ जोखिम, धोखाधड़ी और मनी लॉन्डरिंग का बेहतर पता लगाने के लिए सिंथेटिक डेटा का उपयोग करती हैं।

यहाँ उपयोग‑केस केवल इन जोखिमों का सही पता लगाने के लिए नहीं है, बल्कि कंपनियों की प्रबंधन टीमों को नियामकों और हितधारकों को यह दिखाने के लिए भी है कि इन मुद्दों का पता लगाने और उनसे बचने के लिए हर संभव प्रयास किया जा रहा है, जिससे संभावित रूप से अरबों नुकसान या जुर्माना रोका जा सकता है।

Healthcare

AI के प्रशिक्षण में कुल “अनुभव” को बढ़ाकर, सिंथेटिक डेटा बाद में महामारी विज्ञान, मेडिकल इमेज & लैब परिणाम विश्लेषण, या क्लिनिकल ट्रायल्स में उपयोग किए जाने वाले मॉडलों को प्रशिक्षित करने में मदद कर सकता है।

ऐसे AI को बाद में ज्ञात समूहों और जनसंख्या अध्ययनों पर पुनः‑परीक्षण किया जा सकता है, जिससे उनकी भविष्यवाणी की सटीकता सिद्ध होती है।

Synthetic Data Provider – Tonic.ai

अधिकांश कंपनियाँ जो सिंथेटिक डेटा का उपयोग करती हैं, वे इस क्षेत्र में विशेषज्ञ बाहरी प्रदाताओं पर निर्भर करती हैं।

इसका एक उदाहरण Tonic.ai है, जो लगभग सभी डेटाबेस के साथ एकीकृत हो सकता है, जिससे क्लाइंट के अपने वास्तविक डेटा का उपयोग करके डेटा माइनिंग, विकास और परीक्षण संभव हो जाता है।

स्रोत: Tonic.ai

कंपनी द्वारा प्रस्तावित सेवाओं में शामिल हैं:

स्रोत: Tonic.ai

Tonic.ai टूल्स कई बड़े निगमों द्वारा उपयोग किए जाते हैं, जैसे eBay डेवलपर्स, American Express (AXP ) (नीचे देखें), Volvo, Cigna, Walgreens, आदि।

Synthetic Data User – American Express

AXP मूल्य चार्ट

विश्व के प्रमुख क्रेडिट कार्ड प्रदाताओं में से एक, American Express, व्यापारिक उद्देश्यों के लिए सिंथेटिक डेटा के उपयोग में अग्रणी रहा है, 2020 से पहले ही डीप लर्निंग का उपयोग कर रहा है और Nvidia (NVDA ) हार्डवेयर का उपयोग करता है।

AI Uses for Customers

विशेष रूप से, यह रिपोर्ट किया गया है कि उन्होंने “AI‑जनित नकली धोखाधड़ी पैटर्न का उपयोग करके अपने मॉडलों की दुर्लभ या असामान्य घोटालों को पहचानने की क्षमता को तेज किया”।

“इन तकनीकों का ग्राहक अनुभव पर महत्वपूर्ण प्रभाव पड़ता है, जिससे American Express तेज़ी से पहचान कर नुकसान को रोक सकता है, क्योंकि निर्णय‑निर्धारण प्रक्रिया को स्वचालित किया जाता है।”

Dmitry Efimov – vice president of machine learning research at American Express

यह AI और सिंथेटिक डेटा का उपयोग क्रेडिट जोखिम मूल्यांकन को सुव्यवस्थित करने के लिए भी करता है, जिसमें सामाजिक व्यवहार और वास्तविक‑समय बाजार स्थितियों को भी शामिल किया जाता है।

यह विशेष रूप से जनरेटिव AI के साथ, ग्राहक सेवाओं को सुधारने और कंपनी के चैटबॉट द्वारा ग्राहक अनुरोधों का उत्तर न देने की स्थितियों को कम करने के लिए उपयोग किया जाता है।

इसी बीच, AI एल्गोरिदम ग्राहकों के खर्च के व्यवहार, प्राथमिकताओं और लेन‑देन इतिहास का विश्लेषण करके व्यक्तिगत ऑफ़र और रिवॉर्ड्स सुझाते हैं।

Internal AI Uses

आंतरिक रूप से, AI ने American Express को IT टिकटों की वृद्धि को कम करने में मदद की है, क्योंकि एक प्रतिक्रियात्मक समस्या‑समाधान प्रणाली लागू की गई है, और कंपनी के 9,000 इंजीनियर अब कोडिंग सहायता के लिए GitHub Copilot का उपयोग करते हैं।

यह 5,000 यात्रा सलाहकारों को भी मदद करता है जो फर्म के सबसे विशिष्ट Centurion (ब्लैक) कार्ड और Platinum कार्ड सदस्यों को सलाह देते हैं।

“यात्रा सलाहकारों को बहुत से अलग-अलग विषय संभालने पड़ते हैं। उदाहरण के लिए, एक ग्राहक बार्सिलोना में घूमने लायक प्रमुख स्थानों के बारे में पूछ सकता है, जबकि अगला ब्यूनस आयर्स के पांच सितारा रेस्तरां की जानकारी चाहता है। इतनी सारी जानकारी किसी एक व्यक्ति के दिमाग में बनाए रखना कठिन है, है न?”

Hilary Packer, Amex EVP and CTO

American Express Overview

AI और सिंथेटिक डेटा के अलावा, American Express एक ठोस वित्तीय कंपनी है, जो 2025 में 8‑10% राजस्व वृद्धि की अपेक्षा कर रही है, जो राजस्व वृद्धि के दीर्घकालिक लक्ष्य के अनुरूप है, और प्रति शेयर आय में 12‑16% की वृद्धि की उम्मीद है।

कंपनी अंतरराष्ट्रीय स्तर पर भी तेज़ी से विस्तार कर रही है, एक लंबे समय तक मुख्यतः US बाजार में मौजूद रहने के बाद, अंतरराष्ट्रीय कार्ड सेवाओं के बिल्ड बिज़नेस में वर्ष‑दर‑वर्ष 15% की वृद्धि के साथ।

American Express पर नवीनतम

जॉनाथन एक पूर्व बायोकेमिस्ट शोधकर्ता हैं, जिन्होंने आनुवंशिक विश्लेषण और क्लिनिकल परीक्षणों में काम किया। वह अब एक स्टॉक विश्लेषक और वित्तीय लेखक हैं, जो नवाचार, बाजार चक्र और भू-राजनीति पर अपने प्रकाशन 'The Eurasian Century' में केंद्रित हैं।