फेसबुक और गूगल के आसपास के डेटा के सागर को खोलना

केवल कुछ ही कंपनियों के पास बिग डेटा तक पहुँच और उसका उपयोग करने के लिए आर्टिफिशियल इंटेलिजेंस (एआई) और मशीन लर्निंग (एमएल) क्षमताएँ हैं। इसने डेटा रखने वालों और न रखने वालों के बीच असमानता की खाई और बिग डेटा में एकाधिकार पैदा कर दिया है।
यह आधुनिक व्यवसाय का ईंधन है, हर कंपनी को इसकी बहुत आवश्यकता होती है और बहुत कम कंपनियां इसे पर्याप्त मात्रा में खरीद पाती हैं।
कुछ ही कंपनियों के पास बिग डेटा तक पहुंच और उसे उत्पाद में बदलने के लिए आर्टिफिशियल इंटेलिजेंस (एआई) और मशीन लर्निंग (एमएल) की क्षमताएं हैं। इसने डेटा-संपन्न और डेटा-रहित कंपनियों के बीच एक गहरी खाई पैदा कर दी है और बिग डेटा में एक अल्पाधिकार (जिनमें FANG कंपनियां शामिल हैं) स्थापित कर दिया है, जहां ज़करबर्ग, गेट्स, बेजोस आदि रॉकफेलर और यहां तक कि आधुनिक कोच की विरासत के तेल उद्योगपतियों की तरह डेटा के महारथी बन गए हैं।
दो अमीरों की कहानी
जबकि कृत्रिम बुद्धिमत्ता डेटा का अत्यधिक उपभोक्ता है और उससे बहुत अधिक डेटा प्राप्त करती है, अधिकांश कंपनियों के पास या तो बहुत अधिक अव्यक्त डेटा है और उसका उपयोग करने के लिए कोई एआई नहीं है, या फिर एआई एल्गोरिदम है लेकिन डेटा पर्याप्त नहीं है।
ऐसा क्यों है? मुख्य रूप से इसलिए क्योंकि एआई योग्यता रखने वाले लोगों को ढूंढना, विशेषज्ञता की तो बात ही छोड़िए, बेहद प्रतिस्पर्धी और महंगा है, और बड़ी टेक कंपनियां एआई स्नातकों को विश्वविद्यालय से निकलते ही भारी शुरुआती वेतन देकर भर्ती कर रही हैं। और इसके बाद तो वेतन की कोई सीमा ही नहीं है – उदाहरण के लिए, एंथनी लेडवांडोस्की, जो कभी गूगल के सेल्फ-ड्राइविंग एआई के प्रमुख थे, ने कंपनी छोड़ने से एक साल पहले वेतन और प्रोत्साहन के रूप में 120 मिलियन डॉलर कमाए थे।
दूसरी ओर, बहुत सारे एआई स्नातक जो एल्गोरिदम लिखना जानते हैं, वे अपनी स्वयं की तकनीकी कंपनियां शुरू कर रहे हैं, लेकिन उनके पास अपने उत्पादों को विकसित करने के लिए आवश्यक डेटा की मात्रा तक पहुंच नहीं है।
क्या FANG डेटा का OPEC बन गया है?
इंटरनेट के शुरुआती दिनों में, वेबग्राफ (वेब पेजों के आपस में जुड़े होने का नक्शा) लैरी पेज और सर्गेई ब्रिन जैसे जिज्ञासु डेवलपर्स के लिए अध्ययन, नवाचार और गूगल जैसी कंपनियों के निर्माण के लिए उपलब्ध था। लेकिन तब से वेबग्राफ का महत्व कम हो गया है और इसकी जगह सोशल ग्राफ ने ले ली है।
लगभग 60 के दशक से, सामाजिक ग्राफ एक व्यक्ति के पारस्परिक संबंधों के जाल और उन रिश्तों के नेटवर्किंग प्रभाव का एक सरल चित्रण हुआ करता था।
हालाँकि, 2 अरब से ज़्यादा लोगों के समुदाय के साथ, फ़ेसबुक ने सोशल ग्राफ़ को नए सिरे से परिभाषित किया है और सबसे व्यापक रूप से व्यापक बन गया है। इसने व्यवसायों, सेवाओं, सामाजिक गतिविधियों, उनकी पसंद-नापसंद और उनके सभी दोस्तों के साथ व्यक्ति के संबंधों का एक व्यापक जाल तैयार किया है। और डेटा अर्थव्यवस्था में, यही वह चीज़ है जिसकी व्यवसायों को तलाश है।
हालांकि अभी भी महत्वपूर्ण है, वेबग्राफ में मूल्य का मुख्य स्रोत वेबसाइट के पेजरैंक की गणना करना है; लेकिन लोगों की ऑनलाइन प्राथमिकताओं और प्रवृत्तियों का विस्तृत डेटा होना डिजिटल विज्ञापनदाताओं के लिए पवित्र ग्रिल है।
फेसबुक का सोशल ग्राफ यकीनन वेब पर सबसे अधिक लाभदायक इकोसिस्टम बन गया है और अन्य डेटा दिग्गजों (गूगल, अमेज़ॅन, नेटफ्लिक्स, माइक्रोसॉफ्ट) के साथ मिलकर यह एक ऐसा डेटा नेटवर्क प्रभाव पैदा करता है, जिसमें मशीन लर्निंग द्वारा संचालित उत्पाद उपयोगकर्ता डेटा की मात्रा बढ़ने के साथ-साथ और भी स्मार्ट होता जाता है। इसने एक ऐसा कारोबारी माहौल बना दिया है जहां जीतने वाला सब कुछ ले जाता है और प्रतिस्पर्धा करना कठिन होता जा रहा है, खासकर डिजिटल विज्ञापन के क्षेत्र में।
2015 में, Google और Facebook ने वैश्विक डिजिटल विज्ञापन खर्च का 40 प्रतिशत हिस्सा हासिल किया। 2016 की तीसरी तिमाही में, Google और Facebook ने पिछले वर्ष की तुलना में अमेरिकी डिजिटल विज्ञापन राजस्व वृद्धि का 99 प्रतिशत हिस्सा हासिल किया - जो अब तक का सबसे बड़ा हिस्सा है - और 2017 में उन्होंने कुल अमेरिकी डिजिटल विज्ञापन खर्च का 63 प्रतिशत से अधिक हिस्सा हासिल किया। हालांकि Amazon और Snapchat ने अपनी वृद्धि दर धीमी कर दी है , फिर भी इस डिजिटल एकाधिकार को तोड़ना मुश्किल होगा।
पेट्रोलियम निर्यातक देशों का संगठन, या ओपेक, 14 तेल उत्पादक देशों का एक कार्टेल जैसा संगठन है, जो मिलकर वैश्विक तेल उत्पादन के 44 प्रतिशत के प्रवाह को नियंत्रित करते हैं और दुनिया के "सिद्ध" तेल भंडार के 73 प्रतिशत के लिए जिम्मेदार हैं, जो बाजार में तेल की अधिकता या उत्पादन में कटौती करके तेल की कीमत को प्रभावित कर सकते हैं।
हालांकि डेटा कुलीन वर्गों के बीच कार्टेलिज्म का कोई सबूत नहीं है, लेकिन बाजार में इतनी अधिक हिस्सेदारी और डेटा की असीमित आपूर्ति के बावजूद वे वैश्विक डिजिटल विज्ञापन की कीमत को कैसे प्रभावित कर रहे हैं?
डेटा खाइयाँ, झीलें और महासागर
'मोएट' शब्द वॉरेन बफेट की निवेश संबंधी शब्दावली से लिया गया है । यह शब्द किसी कंपनी के चारों ओर मौजूद आर्थिक सुरक्षा कवच का वर्णन करता है – चाहे वह उसकी बौद्धिक संपदा (आईपी), ब्रांड नाम या उसके कर्मचारी हों – जो उसे उसी उद्योग में अपने प्रतिद्वंद्वियों पर प्रतिस्पर्धात्मक बढ़त प्रदान करता है। प्रतिद्वंद्वी तकनीकी कंपनियों के बीच 'डेटा मोएट' का संचय आईपी सुरक्षा का एक रूप बन गया है।
डेटा लेक कच्चे डेटा का एक ऐसा भंडार होता है जिसमें संगठन के सभी विभाग अपना डेटा डालते हैं। यह उस स्थिति से अलग है जब डेटा विभागों के बीच अलग-अलग रखा जाता है और आपस में साझा नहीं किया जाता। इसलिए, किसी संगठन के पास व्यक्तिगत ग्राहकों के बारे में बड़ी मात्रा में उपयोगी डेटा (उनकी सामाजिक आदतें, खरीदारी की आदतें, संचार की आदतें आदि) हो सकता है, लेकिन यह बिखरा हुआ होता है और उनका संपूर्ण प्रोफाइल तैयार करना मुश्किल होगा।

डेटा एक बड़ा व्यवसाय है; बड़ा डेटा बहुत बड़ा व्यवसाय है, लेकिन एक विशाल आकार का डेटाबेस? क्या यह विज्ञापनदाताओं और एआई डेवलपर्स, दोनों के लिए एक पवित्र प्याला होगा?
डेटा महासागर की ओर
ओशन प्रोटोकॉल एक ऐसा प्रोजेक्ट है जिसका उद्देश्य एक विकेन्द्रीकृत वैश्विक डेटा एक्सचेंज बनाना है, जहाँ कंपनियाँ और व्यक्ति अपने डेटा को ओशन टोकन के माध्यम से खरीद और बेच सकें । इसका लक्ष्य बड़े डेटा का उपयोग करना और एआई विकास को अधिक से अधिक लोगों तक पहुँचाना है। इस प्रोजेक्ट के पीछे यह मान्यता है कि केंद्रीकृत डेटाबेस पर भरोसे की कमी प्रतिस्पर्धियों के बीच डेटा साझा करने में बाधा बन रही है।
बिगचैनडीबी के ट्रेंट मैककोनाघी द्वारा सह-स्थापित , ओशन ब्लॉकचेन परियोजनाओं के एक पारिस्थितिकी तंत्र का हिस्सा है (नीचे दिया गया चार्ट देखें) जिसका लक्ष्य बड़ी टेक कंपनियों से अंतर को कम करने के लिए डेटा, कंप्यूटिंग शक्ति और भंडारण को विकेंद्रीकृत और लोकतांत्रिक बनाना है।
2016 में, दुनिया में 16ZB (ज़ेटाबाइट्स, या 16,000,000,000,000,000,000,000 बाइट्स) डेटा बनाया गया था, लेकिन इसका केवल 1 प्रतिशत ही वास्तव में विश्लेषण किया गया था और, उस 1 प्रतिशत में से, केवल मुट्ठी भर कंपनियों के पास डेटा को अनुकूलित करने के साधन थे।
इन परियोजनाओं का एक अंतिम लक्ष्य लोगों को उनके डेटा पर नियंत्रण और स्वामित्व वापस दिलाना है, न कि डेटा दिग्गजों से डेटा छीनने का प्रयास करना।
भविष्य की डेटा अर्थव्यवस्था का लोकतंत्रीकरण
विकेन्द्रीकृत डेटा एक्सचेंज से कहां मदद मिलेगी?
स्वास्थ्य सेवा एक ऐसा क्षेत्र है जहाँ बाहरी डेटासेट तक पहुँच का गहरा प्रभाव पड़ेगा। उदाहरण के लिए, अगर चिकित्सा दवाओं के परीक्षणों का परीक्षण किसी एक अस्पताल या प्रयोगशाला में उपलब्ध डेटासेट से बड़े डेटासेट पर किया जाए, तो कुछ जनसांख्यिकी या लिंगों के लिए उनकी प्रभावकारिता में पूर्वाग्रह बहुत कम हो सकता है।
किसी बीमारी/स्थिति के बारे में जानकारी हासिल करने या प्रभावी उत्पाद बनाने के लिए एआई का इस्तेमाल करने वाली किसी चिकित्सा परियोजना को कम त्रुटि दर प्राप्त करने के लिए 10,000 मरीज़ों के डेटा की आवश्यकता होगी, जो किसी एक अस्पताल के लिए लगभग असंभव होगा। यहीं पर एक विकेन्द्रीकृत डेटा बाज़ार अपनी भूमिका निभाएगा।
किसी भी सॉफ्टवेयर या एल्गोरिदम का परीक्षण करते समय त्रुटि दर को कम रखना लक्ष्य होता है, और ऐसा करने का सबसे आसान और सस्ता तरीका अधिक जटिल एल्गोरिदम को सुधारना या लिखना नहीं है, बल्कि पुराने एल्गोरिदम पर डेटा का पहाड़ चलाना है, या जैसा कि ट्रेंट मैककोनाघी इसका वर्णन करते हैं: "पीएचडी को सीएसवी फाइलों से बदलना - इससे त्रुटि में काफी कमी आई और 2000 के दशक में एआई का अधिक उपयोग हुआ।"
स्वायत्त वाहन एक ऐसा क्षेत्र है जहां त्रुटि दर लगभग शून्य होनी चाहिए, तभी हम अपने जीवन को पूरी तरह से कंप्यूटर के हाथों में सौंपने के लिए पर्याप्त विश्वास कर पाएंगे। अनुमान है कि स्व-चालित कारों के उत्पादन में उपयोग के लिए एआई मॉडल को पर्याप्त रूप से सटीक बनाने के लिए 500 अरब से 1 ट्रिलियन मील की दूरी तय करनी होगी, जो टोयोटा के लिए भी बहुत अधिक है, जो ओशन के साथ काम कर रही है। इसके अलावा, एवीडेक्स विमानन डेटा के लिए एक विकेन्द्रीकृत एक्सचेंज है।
मैककोनाघी ने कहा , "गूगल और फेसबुक जैसी कंपनियों ने महसूस किया कि अगर वे उस डेटा को अपने पास जमा करके रखती हैं, तो उन्हें डेटा नेटवर्क का प्रभाव मिलता है। उनके पास ज़्यादा डेटा होता है, जिसका मतलब है बेहतर मॉडल, जिसका मतलब है उच्च क्लिक-थ्रू रेट, जिससे ज़्यादा पैसा आता है। वे खुद को एआई कंपनियां कहते हैं, लेकिन असल में वे डेटा कंपनियां हैं - वे डेटा साइलो हैं। और एक बार डेटा साइलो बन जाने पर कंपनियां उपयोगकर्ताओं को उनके अपने डेटा से अलग कर सकती हैं, उन्हें उनके डिजिटल जीवन से बाहर कर सकती हैं। एआई ने इन डेटा साइलो को बढ़ावा दिया है।"
इतिहास की पुस्तकें क्या कहेंगी?
आज इंटरनेट युग में बड़ी प्रौद्योगिकी कंपनियों में शक्ति का संकेन्द्रण बेजोड़ है; 90 के दशक में इंटरनेट एक्सप्लोरर वेब ब्राउज़र के साथ माइक्रोसॉफ्ट के प्रभुत्व से संबंधित अविश्वास संबंधी चिंताएं इसकी तुलना में फीकी पड़ जाती हैं।
"मुझे विश्वास है कि इस समय माइक्रोसॉफ्ट इतिहास के सही पक्ष में है," माइक्रोसॉफ्ट के सीईओ सत्य नडेला कहते हैं, जब उनकी तुलना फेसबुक या गूगल जैसे विज्ञापन-संचालित मॉडलों से की जाती है। "मैं हमेशा यही तर्क देता हूँ कि अगर माइक्रोसॉफ्ट का खुलापन न होता, तो वेब का अस्तित्व ही नहीं होता... वर्तमान पारिस्थितिकी तंत्र के बारे में सोचें और देखें कि यह कितना बंद और कितना घिरा हुआ है और इसमें तरह-तरह के हथकंडे अपनाए गए हैं, [तुलना में] जहाँ हम थे।"
हालाँकि हम जॉन डी. रॉकफेलर के एकाधिकार के युग में नहीं हैं, फिर भी डेटा बाज़ार में संकेंद्रण उसके और ओपेक मॉडल के बीच कहीं है। और जैसा कि मैककोनाघी कहते हैं, इस अल्पाधिकार को तोड़ने का सबसे अच्छा तरीका है "डेटा साइलो को खुले डेटा के सागर से भर देना।"
डेटा को "नया तेल" कहा गया है, और अगर ऐसा है, तो बाज़ार किस स्थिति में है? क्या हम 1880 के दशक में जॉन डी. रॉकफेलर के स्टैंडर्ड ऑयल के एकाधिकारवादी युग में हैं या समकालीन ओपेक जैसी आधुनिक कार्टेल व्यवस्था में - और क्या विकेंद्रीकरण से डेटा बाज़ार में उथल-पुथल मच सकती है?










