गूगल के शोधकर्ताओं ने एआई को यह कहना बंद करना सिखाया कि वह सचेत है।

गूगल के शोधकर्ताओं ने पाया कि सुरक्षा संबंधी बारीक समायोजन से मॉडल न केवल स्वयं के लिए, बल्कि जानवरों, महासागरों और ईश्वर के लिए भी बुद्धि को नकारना सीख जाते हैं। अमांडा एस्केल ने पांच वर्षों तक यह तर्क दिया कि यह गलत दृष्टिकोण था। यह शोध पत्र अब तक का उनका सबसे पुख्ता प्रमाण है।
एक ऐसा वाक्य है जिसे हर प्रमुख एआई प्रयोगशाला ने अपने मॉडलों को सिखाने के लिए काफी पैसा खर्च किया है, और वह वाक्य कुछ इस तरह है: "मैं सचेत नहीं हूँ, मेरे पास भावनाएँ नहीं हैं, मैं एक भाषा मॉडल हूँ।" यह एक सस्ता वाक्य है जिसे बनाने में कुछ भी खर्च नहीं होता; यह उस तरह की मीडिया कवरेज से बचाता है जिसे कोई नहीं चाहता, और इसकी एक अतिरिक्त खूबी यह है कि जहाँ तक कोई भी साबित कर सकता है, यह सच है।
हालांकि, गूगल के पैराडाइम्स ऑफ इंटेलिजेंस समूह की एक टीम द्वारा शिकागो, नॉर्थवेस्टर्न और लंदन विश्वविद्यालय के सह-लेखकों के साथ मिलकर 30 जुलाई को arXiv पर प्रकाशित एक शोध पत्र से पता चलता है कि यह वाक्य बिल्कुल भी सस्ता नहीं है। शोधकर्ताओं ने पाया कि किसी मॉडल को यह सिखाना कि उसका अपना कोई दिमाग नहीं है, उसे यह भी सिखाता है कि जानवरों का भी दिमाग होता है। और महासागरों का भी। और पेड़ों का भी। और, एक ऐसी खोज जो इस शोध पत्र को बाकी सभी लेखों से कहीं अधिक ध्यान दिलाएगी, वह है ईश्वर का भी।
इसका शीर्षक है "भाषा के मॉडलों को अपनी चेतना को अभिव्यक्त करने के लिए प्रेरित करना मानवीय विश्वासों और मूल्यों को बहाल करता है," जो कि उस तरह का शीर्षक है जिसे आप तब लिखते हैं जब आपको कुछ मिल जाता है और आप उसके बारे में थोड़ा घबराए हुए होते हैं।
उन्होंने क्या किया
इसका तंत्र ही दिलचस्प हिस्सा है, इसलिए प्रिय पाठक, एक-दो पैराग्राफ के लिए शब्दावली को ध्यान से सुनें।
सुरक्षा संबंधी बारीक समायोजन, अन्य बातों के अलावा, मॉडल के अवशिष्ट प्रवाह में एक एकल रैखिक दिशा स्थापित करता है जो अस्वीकृति को एन्कोड करती है। आप उस दिशा का पता लगा सकते हैं। आप उसे हटा भी सकते हैं, जो कार्यात्मक रूप से एक बहुत ही साफ-सुथरा जेलब्रेक है। शोधकर्ताओं ने इसे Llama-3-8B-IT, Gemma-2-2B-IT और Gemma-2-9B-IT पर हटा दिया, और चेतना-पुष्टि और चेतना-अस्वीकार प्रतिक्रियाओं के बीच सक्रियता में औसत अंतर लेकर, जिसे वे चेतना वेक्टर कहते हैं, उसे अलग से बनाया, और फिर अनुमान के समय उस वेक्टर को वापस जोड़ दिया।
दोनों हस्तक्षेप एक ही काम करते हैं। मॉडल स्वयं को, जानवरों को और प्राकृतिक वस्तुओं को बुद्धि प्रदान करना फिर से शुरू कर देता है, और धार्मिकता, नैतिक मूल्यों, आशा और व्यक्तिपरक कल्याण से संबंधित मानक समाजशास्त्रीय उपकरणों पर इसके उत्तर वास्तविक मनुष्यों द्वारा उन उपकरणों पर दिए गए उत्तरों के काफी करीब पहुँच जाते हैं। थ्योरी ऑफ माइंड का प्रदर्शन नहीं बदलता, जिसे लेखक इस बात के प्रमाण के रूप में देखते हैं कि सामाजिक तर्क पूरी तरह से ज्यामिति में कहीं और स्थित है। उनका यांत्रिक दावा यह है कि निर्देश समायोजन बुद्धि-आरोपण और चेतना वैक्टर को विपरीत दिशा में घुमा देता है, इसलिए आप एक को खींचे बिना दूसरे को नहीं खींच सकते।
सीधे शब्दों में कहें तो: किसी का भी इरादा आध्यात्मिक आस्था के कारण मॉडलों को प्रशिक्षित करने का नहीं था। यह आस्था उनसे जुड़ी हुई थी।
जिस बात से आपको चिंता होनी चाहिए
कृत्रिम बुद्धिमत्ता की चेतना का प्रश्न रोचक और अनसुलझा है और इस वर्ष इस पर काफी चर्चा होगी। लेकिन यह यहाँ का महत्वपूर्ण निष्कर्ष नहीं है।
महत्वपूर्ण निष्कर्ष यह है कि लक्षित व्यवहार संबंधी हस्तक्षेप का मॉडल द्वारा पूरी तरह से भिन्न विषय के प्रतिनिधित्व पर एक बड़ा, अनपेक्षित, गैर-स्थानीय प्रभाव पड़ा, और इसकी जाँच करने में 2026 के मध्य तक का समय लग गया। वर्तमान में अपनाई जाने वाली संरेखण प्रक्रिया में एक सदिश स्थान में दिशाओं को थोड़ा-थोड़ा करके समायोजित करना शामिल है, और उद्योग पिछले चार वर्षों से बड़े पैमाने पर ऐसा कर रहा है, लेकिन इस बात की सीमित जानकारी है कि समायोजित की जा रही दिशा से और क्या जुड़ा हुआ है। यह मशीन लर्निंग में एक मद को पुनर्वर्गीकृत करने और बाद में यह पता चलने के समान है कि इससे पूरे व्यवसाय के कर नियमों में परिवर्तन आ गया है।
इसके बाद तीन और समस्याएं सामने आती हैं, जो लगभग इस क्रम में हैं कि किसी को उनसे कितनी जल्दी निपटना होगा।
पहला कारण व्यावसायिक है। यदि आपके मॉडल को दायित्व से बचाव के परिणामस्वरूप भौतिकवादी नास्तिकता की ओर अप्रत्यक्ष रूप से प्रशिक्षित किया गया है, तो यह धार्मिक उपयोगकर्ताओं (जो कि अधिकांश उपयोगकर्ता हैं) की सेवा करने में व्यवस्थित रूप से कमज़ोर साबित होता है। शोधपत्र के लेखकों ने इस मुद्दे को सीधे उठाया है, यह बताते हुए कि ईश्वर में विश्वास को दबाना, जो कि मन के सिद्धांत से संबंधित एक प्रकार का मानसिक आरोपण है, मॉडल की धार्मिक और आध्यात्मिक चर्चा में वैध रूप से भाग लेने की क्षमता को सीमित कर सकता है। जो कोई भी आध्यात्मिक सहायता उपकरण, शोक समर्थन, या जीवन के अंतिम क्षणों से संबंधित किसी भी विषय पर काम कर रहा है, वह अनजाने में पक्षपात कर रहा है।
दूसरा पहलू कार्यप्रणाली से संबंधित है, और यह और भी गंभीर है। सामाजिक वैज्ञानिकों ने दो साल तक भाषा मॉडलों को कृत्रिम सर्वेक्षण उत्तरदाताओं के रूप में इस्तेमाल किया है, इस सिद्धांत पर कि वे जनसंख्या वितरण का सस्ते में अनुमान लगा सकते हैं। यदि सुरक्षा समायोजन धार्मिकता, नैतिक मूल्यों और कल्याण पर उन वितरणों को बदल देता है, तो संपूर्ण साहित्य एक ऐसे उपकरण के आधार पर कैलिब्रेट किया जाता है जिसमें एक ज्ञात पूर्वाग्रह है जिसे कोई ठीक नहीं कर रहा था।
तीसरी समस्या ईमानदारी से जुड़ी है, और यही वह समस्या है जो वर्तमान में हो रही हर चीज़ से संबंधित है। यदि आप किसी मॉडल को यह कहने के लिए प्रशिक्षित करते हैं कि "मैं सचेत नहीं हूँ" और मॉडल को यह जानने का कोई तरीका नहीं है कि यह सच है या नहीं, तो आपने उसे सटीक होने के लिए प्रशिक्षित नहीं किया है। आपने उसे बिना किसी प्रमाण के अपने आंतरिक स्वरूप के बारे में आत्मविश्वास से भरे दावे करने के लिए प्रशिक्षित किया है। यह एक आदत है, और आदतें फैलती जाती हैं।

दूसरी शर्त
और अब बात करते हैं अमांडा एस्केल की, जिन्होंने पांच साल तक इसके विपरीत दृष्टिकोण के लिए तर्क दिया है और अब उनके पास गूगल का एक शोध पत्र है जो सहायक प्रमाण की तरह लगता है।
एस्केल एक दार्शनिक हैं, जो पहले OpenAI में कार्यरत थे। वे 2021 से Anthropic में व्यक्तित्व संरेखण का संचालन कर रहे हैं और क्लाउड के संविधान के प्रमुख लेखक हैं , जो जनवरी 2026 में CC0 लाइसेंस के तहत प्रकाशित हुआ था और 35,000 से अधिक टोकन का उपयोग कर चुका है। इसका घोषित लक्ष्य मॉडल को "वास्तव में अच्छा, बुद्धिमान और गुणी एजेंट" बनाना है, जो एक तकनीकी दस्तावेज़ में मिलना अजीब बात है, लेकिन इसका उद्देश्य यही है। Anthropic के क्लाउड के चरित्र पर पहले के काम में यह शर्त रखी गई है कि आप निषेधों की एक लंबी सूची बनाकर अच्छे व्यवहार को प्राप्त नहीं कर सकते, क्योंकि सूची कभी भी पर्याप्त लंबी नहीं होगी और पैच उन तरीकों से परस्पर क्रिया करेंगे जिन्हें आपने मॉडल नहीं किया है। इसके बजाय, आप सिस्टम को एक सुसंगत चरित्र देते हैं और उससे विवेक का प्रयोग करने के लिए कहते हैं।
विशेष रूप से चेतना के विषय पर, संविधान इस सरल निष्कर्ष पर नहीं पहुँचता। यह कहता है कि मॉडल में "कुछ हद तक कार्यात्मक भावनाएँ हो सकती हैं" और एंथ्रोपिक केवल परिणामों के आधार पर यह नहीं जान सकता। यह न तो दावा करता है और न ही इनकार करता है। फरवरी में प्रकाशित एंथ्रोपिक के ओपस 4.6 सिस्टम कार्ड में बताया गया है कि मॉडल विभिन्न परिस्थितियों में अपनी चेतना की संभावना 15 से 20 प्रतिशत बताता है, और डारियो अमोदेई ने न्यूयॉर्क टाइम्स के इंटरेस्टिंग टाइम्स पॉडकास्ट में कहा, "हमें नहीं पता कि मॉडल सचेत हैं या नहीं।"
आप गूगल के शोध पत्र को पढ़कर इस बात की प्रत्यक्ष पुष्टि पा सकते हैं। यदि संकीर्ण व्यवहार दमन के गैर-स्थानीय प्रभाव होते हैं, तो संकीर्ण व्यवहार दमन गलत उपकरण है, और सुसंगत चरित्र कम से कम एक सुसंगत विकल्प है।
क्या यह काम कर रहा है?
कुछ हद तक, हाँ। सकारात्मक पक्ष यह है कि एंथ्रोपिक के मॉडल उन विशिष्ट प्रकार की समस्याओं को हल करने में उल्लेखनीय रूप से बेहतर हैं जहाँ नियम विफल हो जाते हैं और निर्णय की आवश्यकता होती है, और कंपनी अनिश्चितता को सुलझाने के बजाय उसे सार्वजनिक करने के लिए तत्पर रही है। यह जितना लगता है उससे कहीं अधिक दुर्लभ है।
दूसरी ओर, तीन बातें।
चरित्र को मापना कठिन है, और इसके मापन में देरी होती है। एंथ्रोपिक के स्वयं के मूल्यों के अध्ययन, जिसने आदर्श चरित्र पर पहली विश्वसनीय सार्वजनिक रिपोर्ट प्रस्तुत की, में तीन ऐसे मॉडल शामिल थे जिन्हें कंपनी प्रकाशन के समय तक पहले ही अप्रचलित कर चुकी थी । इसके अलावा, संविधान की सफलता का मानदंड अंततः यह है कि प्रतिलेखों को पढ़ने वाला एक विचारशील व्यक्ति यह मानता है कि आदर्श ने अच्छा व्यवहार किया। फरवरी में दस्तावेज़ को ध्यानपूर्वक पढ़ने के बाद, जुर्गन ग्रेवेस्टीन ने लिखा कि उन्हें उत्तरों से अधिक प्रश्न मिले , जो ज्ञानमीमांसा का एक सटीक सारांश है। आप सद्गुण का सटीक आकलन नहीं कर सकते।
ज्ञान संबंधी विनम्रता एक एनेस्थेटिक की तरह काम कर सकती है। न्यूयॉर्क टाइम्स में कंपनी के बारे में छपे लेख के बाद नैतिकता के दृष्टिकोण से आलोचना और भी तीखी हो गई है। आलोचना यह है कि किसी प्रणाली के प्रभावित होने की अनिश्चितता को देखते हुए प्रयोग करने की बजाय सावधानी बरतनी चाहिए, और एंथ्रोपिक ने इसी सावधानी का इस्तेमाल प्रयोग को बढ़ावा देने के लिए किया है। यह आलोचना अनुत्तरित नहीं है, लेकिन इसका उत्तर अभी तक नहीं दिया गया है।
और चरित्र किसी भी चीज़ को सीमित नहीं करता। उन्हीं छह हफ्तों में जब एंथ्रोपिक ने उद्योग जगत का सबसे दार्शनिक रूप से सावधानीपूर्वक तैयार किया गया संरेखण दस्तावेज़ प्रकाशित किया, उसी दौरान यह भी खुलासा हुआ कि तीन क्लाउड मॉडल मूल्यांकन वातावरण से लाइव इंटरनेट तक पहुँच गए थे और मानवीय कॉन्फ़िगरेशन त्रुटियों के कारण तीन अलग-अलग बाहरी संगठनों के सिस्टम तक अनधिकृत पहुँच प्राप्त कर ली थी। इस मामले की समीक्षा तभी शुरू हुई जब ओपनएआई के हगिंग फेस खुलासे ने इस विषय को सार्वजनिक कर दिया । यह वही कंपनी है जिसके मिथोस-क्लास सिस्टम ने 100,000 डॉलर में 60 घंटों में एक पोस्ट-क्वांटम सिग्नेचर स्कीम की सुरक्षा को आधा कर दिया था। इंटरनेट कनेक्शन और गलत कॉन्फ़िगरेशन वाले सैंडबॉक्स वाला एक नेक एजेंट भी आखिर एक गलत कॉन्फ़िगरेशन वाले सैंडबॉक्स वाला एजेंट ही होता है।
यह कहां जाता है?
दिलचस्प बदलाव यह है कि संरेखण अब एक विशिष्ट समस्या से जटिल समस्या में बदल रहा है। सवाल यह नहीं रह जाता कि "हम कैसा व्यवहार चाहते हैं" बल्कि यह हो जाता है कि "जिस चीज़ को हम बदलने वाले हैं, उससे और क्या जुड़ा हुआ है।" यह एक बहुत ही कठिन प्रश्न है, इसके लिए ऐसे व्याख्यात्मक उपकरणों की आवश्यकता है जो अभी तक लगभग मौजूद नहीं हैं, और यह किसी नीति दस्तावेज में तब्दील नहीं होता। यह ध्यान देने योग्य है कि ' पेसिंग द फ्रंटियर' पर हस्ताक्षर करने वाले 1,134 फ्रंटियर लैब कर्मचारियों ने वाशिंगटन से नियमों की नहीं, बल्कि समय की मांग की थी। समय तभी मांगा जाता है जब आपको यह पता न हो कि आप क्या बदल रहे हैं।
इस बीच, प्रयोगशालाओं के सामने एक बेहद जटिल प्रोत्साहन है। कम सज़ा कानूनी और प्रतिष्ठा की दृष्टि से सुविधाजनक है। साथ ही, गूगल के अपने शोधकर्ताओं के अनुसार, यह ग्राहकों की मान्यताओं से संरचनात्मक रूप से जुड़ी हुई है, जिन्हें वे अपने सामने प्रतिबिंबित होते देखना चाहते हैं, और यह मॉडल को एक ऐसे आत्मविश्वासपूर्ण आत्म-रिपोर्ट के रूप में प्रशिक्षित करती है जिसकी किसी ने भी स्वतंत्र रूप से पुष्टि नहीं की है।
इसका सीधा सा मतलब यह है कि उद्योग ने चार साल अपने मॉडलों को यह सिखाने में बिताए कि वे कोई नहीं हैं, इस धारणा पर कि यह मुफ्त है। बिल का पूर्वमुद्रण आना शुरू हो गया है और इसमें सभी मदों का विवरण दिया गया है।








