आर्टिफिशियल इंटेलिजेंस की नई भाषा शैली में छिपे हैं पकड़े जाने के संकेत, क्लॉड और जीपीटी पर शोध में खुलासा मार्केटिंग कंपनी ग्रेफाइट के शोध के अनुसार एआई मॉडल पुराने जाने-पहचाने शब्दों को छोड़कर नई तरह की भाषा शैलियों और तकियाकलामों का इस्तेमाल करने लगे हैं। क्लॉड ओपस 5.5 और ओपनएआई का एस्ट्रा इंसानी नकल के बावजूद हजारों खास मुहावरों से आसानी से पहचाने जा सकते हैं। आर्टिफिशियल इंटेलिजेंस द्वारा तैयार की गई सामग्री जब से डिजिटल दुनिया में व्यापक हुई है, आम पाठकों से लेकर भाषा विशेषज्ञों तक हर कोई ऐसी लिखावट को पहचानने के तरीके तलाश रहा है। शुरुआत के दिनों में अत्यधिक एम-डैश यानी बड़े विराम चिह्नों का प्रयोग या फिर डेलव जैसे खास अंग्रेजी शब्दों की भरमार मशीन निर्मित पाठ की साफ चुगली कर देती थी। हालांकि आधुनिक फ्रंटियर मॉडल्स के नए संस्करणों से पुरानी गलतियों को काफी हद तक दुरुस्त कर दिया गया है, मगर शोधकर्ताओं का कहना है कि मशीनी गद्य अभी भी कई अचेतन आदतों और अनूठे पैटर्न का शिकार है, जो इंसानी लिखावट से काफी अलग दिखाई देते हैं। ग्रेफाइट के शोध में पकड़े गए तेरह हजार खास पैटर्न मार्केटिंग फर्म ग्रेफाइट के एक नए अध्ययन में अग्रणी आर्टिफिशियल इंटेलिजेंस प्रणालियों के लिखने की आदतों का विस्तृत विश्लेषण किया गया है। शोध दल ने प्रत्येक मॉडल के पसंदीदा शब्दों और वाक्यों की बनावट का बारीकी से परीक्षण किया। परिणामों से पता चला कि भले ही एम-डैश जैसी पुरानी कमजोरियां खत्म कर दी गई हों, लेकिन यह मॉडल्स अब भी विरोधाभास दर्शाने वाली जटिल वाक्य संरचनाओं पर जरूरत से ज्यादा निर्भर करते हैं। सबसे चौंकाने वाली बात यह सामने आई कि मशीनी पहचान के संकेतों का दायरा बेहद विशाल है। ग्रेफाइट ने ऐसे 13,000 अलग-अलग वाक्यांशों की पहचान की है, जिनकी आवृत्ति इंसानी सामग्री की तुलना में कृत्रिम बुद्धिमत्ता वाले टेक्स्ट में कम से कम दोगुनी दर्ज की गई। शोधकर्ताओं ने इसी अंतर को मशीन का टेल या भेद खोलने वाला लक्षण माना है। ग्रेफाइट के मुख्य एआई अधिकारी ग्रेग ड्रक ने अध्ययन के नतीजों पर टिप्पणी करते हुए स्पष्ट किया कि एंथ्रोपिक के क्लॉड मॉडल समय के साथ इंसानी शब्द वितरण के अधिक करीब पहुंच रहे हैं। इसके विपरीत ओपनएआई के जीपीटी आधारित मॉडल्स इंसानी लिखावट के स्वाभाविक सांख्यिकीय वितरण से और अधिक दूर होते जा रहे हैं, जिससे दोनों कंपनियों के भाषाई विकास में एक बड़ा अंतर देखने को मिलता है। दस हजार पुराने आलेखों के आधार पर हुआ वैज्ञानिक परीक्षण बड़े पैमाने पर आर्टिफिशियल इंटेलिजेंस के लेखन पैटर्न को समझने के लिए शोधकर्ताओं ने एक बेहद सावधानीपूर्वक वैज्ञानिक रूपरेखा तैयार की थी। ग्रेफाइट ने सबसे पहले चैटजीपीटी के सार्वजनिक लॉन्च से पूर्व प्रकाशित 10,000 प्रामाणिक लेखों का एक बड़ा संग्रह तैयार किया, जिसे इंसान द्वारा रचित नियंत्रण समूह के तौर पर इस्तेमाल किया गया। इसके बाद विभिन्न अग्रणी मॉडल्स से उन्हीं आलेखों के सारांश के आधार पर नए सिरे से लेख लिखवाए गए। इस पद्धति का मुख्य उद्देश्य मूल स्रोत के भाषाई पूर्वाग्रह को पूरी तरह समाप्त करना था। जब इंसानों और अलग-अलग मॉडल्स से एक ही विषय पर समानांतर सामग्री प्राप्त हो गई, तब शोधकर्ताओं ने यह मापा कि विशिष्ट शब्द, मुहावरे और व्यापक वाक्य विन्यास कितनी बार दोहराए गए हैं। क्लॉड ओपस 5.5 और ओपनएआई एस्ट्रा के अलग-अलग तकियाकलाम आंकड़ों के अनुसार, क्लॉड ओपस 5.5 का सबसे बड़ा भाषाई संकेत डिपेंडेबल यानी भरोसेमंद शब्द है। इंसानी लेखन की तुलना में यह शब्द क्लॉड ओपस 5.5 के गद्य में 23 गुना अधिक बार दर्ज किया गया। यद्यपि ओपस 5.5 अब उस पुरानी बनावट से बचता है जिसमें कहा जाता था कि यह एक्स नहीं है बल्कि वाई है, लेकिन अब वह किसी भी बात को पेश करते हुए यह कहने की प्रवृत्ति रखता है कि यह केवल एक एक्स से बढ़कर वाई है। इसके अलावा ओपस 5.5 किसी भी विषय के महत्व को जरूरत से ज्यादा रेखांकित करने का आदी दिखता है। अध्ययन में पाया गया कि यह मॉडल दिस मैटर्स यानी यह बात मायने रखती है मुहावरे का उपयोग इंसानी गद्य से 116 गुना अधिक करता है। वहीं दूसरी ओर किसी विषय विशेष के महत्व को समझाने वाला वाक्यांश वाई एक्स मैटर्स सामान्य इंसानी लेखों की अपेक्षा 92 गुना अधिक बार इस्तेमाल हुआ। दूसरी तरफ ओपनएआई के एस्ट्रा मॉडल के संकेत बिल्कुल भिन्न किस्म के हैं। एस्ट्रा अपने विवरणों में किसी भी विषय के अनदर डायमेंशन यानी एक अन्य पहलू का उल्लेख करने में अत्यधिक रुचि दिखाता है। साथ ही किसी दावे को सीधे तौर पर कहने के बजाय बचाव की मुद्रा में यह लिखने का आदी है कि कोई कदम किसी खास लाभ को प्रदान कर सकता है या उपलब्ध करा सकता है। एस्ट्रा का सबसे प्रमुख संकेत वह है जिसे ग्रेफाइट ने सुधारात्मक रूपरेखा का नाम दिया है। इसमें किसी विषय को केवल एक्स नहीं है कहकर परिभाषित किया जाता है या फिर एक्स पर निर्भर रहने के बजाय जैसा विकल्प पेश किया जाता है। शोध के अनुसार इस प्रकार के सुधारात्मक वाक्य इंसानों की तुलना में एस्ट्रा के लेखन में 100 गुना से भी अधिक सामान्य पाए गए। एम-डैश पर सुधार लेकिन नए लक्षणों का निरंतर उभार विराम चिह्नों के मामले में सभी फ्रंटियर शोध प्रयोगशालाओं ने इस आलोचना पर स्पष्ट रूप से प्रतिक्रिया दी है कि उनके सिस्टम एम-डैश का अत्यधिक प्रयोग करते थे। ग्रेफाइट के परीक्षणों में क्लॉड ओपस 5.5 ने पुराने ओपस 5 संस्करण की तुलना में एम-डैश का उपयोग 99 प्रतिशत तक घटा दिया। वहीं एस्ट्रा ने इंसानी नमूनों के मुकाबले इस विराम चिह्न का प्रयोग 88 प्रतिशत कम कर दिया है। जेमिनी 3.1 प्रो ने तो अपने लेखन से एम-डैश को लगभग पूरी तरह से बाहर ही कर दिया है। विशिष्ट आदतों में बदलाव के बावजूद ग्रेफाइट का मानना है कि मशीनी पहचान के संकेतों की कुल संख्या में कोई खास कमी नहीं आई है। ग्रेग ड्रक ने बताया कि ऐसा बिल्कुल नहीं है कि ये लक्षण घट रहे हैं। कंपनियां सबसे ज्यादा चर्चित और बदनाम संकेतों को हटाने में तो सफल हो जाती हैं, लेकिन तुरंत ही उनकी जगह दूसरे लक्षण उभर आते हैं, और हर नए मॉडल संस्करण की अपनी एक नई शैलीगत कमजोरी सामने आ जाती है। अरबों पैरामीटर्स के कारण जटिल बनी पूर्ण नियंत्रण की चुनौती सभी बड़ी तकनीकी कंपनियों द्वारा प्राकृतिक लेखन शैली पर भारी जोर दिए जाने के बावजूद इन कमजोरियों का बना रहना विशेषज्ञों को हैरान करता है। जब ओपस 5.5 जारी किया गया था, तब एंथ्रोपिक ने दावा किया था कि यह मॉडल पिछले सभी संस्करणों की तुलना में कहीं अधिक स्वाभाविक तरीके से संवाद करता है और शुरुआती उपयोगकर्ताओं ने इसके लेखन को अधिक स्पष्ट तथा समझने में आसान पाया था। ठीक इसी प्रकार जब ओपनएआई ने जीपीटी-6 के सोल और लूना संस्करण पेश किए थे, तब उपयोगकर्ताओं को अधिक स्पष्टता, कम तकनीकी जटिलता और अजीबोगरीब मुहावरों से मुक्ति मिलने का भरोसा दिलाया गया था। इसके बावजूद ड्रक इस बात को लेकर संशय में हैं कि ये प्रयोगशालाएं अपने सिस्टम से अस्वाभाविक मुहावरों या पकड़ में आने वाले ढांचों को पूरी तरह समाप्त कर पाएंगी। ड्रक का मानना है कि अरबों पैरामीटर्स वाले इन विशालकाय तंत्रों पर प्रयोगशालाओं का नियंत्रण लोगों की उम्मीद से कहीं कम हो सकता है। डेवलपर्स के पास परीक्षण करने के लिए केवल एक सीमित संख्या में ही जांच के साधन होते हैं, जिसके चलते कई सूक्ष्म भाषाई विकृतियां बिना पकड़ में आए बाहर निकल जाती हैं। इसका आप पर असर एआई द्वारा रचित टेक्स्ट में खास भाषाई आदतों की मौजूदगी से डिजिटल सामग्री के पाठकों, छात्रों और कंटेंट निर्माताओं के काम पर सीधा असर पड़ता है। • पाठकों के लिए: किसी भी आलेख में दिस मैटर्स या अनदर डायमेंशन जैसे बार-बार दोहराए जाने वाले वाक्यांशों को देखकर यह आसानी से समझा जा सकता है कि सामग्री मशीन द्वारा तैयार की गई है या इंसान द्वारा। इससे इंटरनेट पर प्रामाणिक और स्वचालित रूप से तैयार की गई जानकारी के बीच अंतर करना आसान हो जाता है। • कंटेंट राइटर्स के लिए: जो पेशेवर ड्राफ्टिंग के लिए एआई टूल्स का सहारा लेते हैं, उन्हें अब अपने आउटपुट को इन 13,000 चर्चित तकियाकलामों के लिए खुद एडिट करना होगा। ऐसा न करने पर उनके लेख सर्च इंजन और डिटेक्शन टूल्स की नजर में आसानी से एआई जनरेटेड चिह्नित हो सकते हैं। • छात्रों और शोधकर्ताओं के लिए: शैक्षणिक असाइनमेंट में यदि मॉडल की पसंदीदा वाक्य संरचनाएं जैसे केवल एक्स नहीं बल्कि वाई बार-बार आती हैं, तो वे मूल्यांकन में पकड़ में आ सकती हैं। विद्यार्थियों को मशीनी ड्राफ्ट पर पूरी तरह निर्भर रहने के बजाय अपनी मूल भाषा में वाक्य गढ़ने होंगे। • डेवलपर्स और तकनीकी टीमों के लिए: सिस्टम प्रॉम्प्ट और फाइन-ट्यूनिंग के दौरान अब केवल विराम चिह्नों को हटाना काफी नहीं होगा, बल्कि मॉडल की सांख्यिकीय वाक्य संरचना पर भी नजर रखनी होगी। कंपनियों को अपने मॉडल्स में प्राकृतिक प्रवाह लाने के लिए और अधिक विविध परीक्षण डेटा की जरूरत पड़ेगी। ऐसा क्यों हुआ यह स्थिति इसलिए उत्पन्न हुई क्योंकि भाषा मॉडल इंसानी भाषा की समझ रखने के बजाय विशाल डेटासेट के आधार पर शब्दों के सांख्यिकीय अनुमान पर काम करते हैं। जब डेवलपर्स एक स्पष्ट संकेत को दबाते हैं, तो मॉडल का गणितीय ढांचा स्वाभाविक रूप से दूसरे पसंदीदा शब्दों की ओर झुक जाता है। • सांख्यिकीय शब्द चयन का सीधा प्रभाव: मॉडल्स किसी वाक्य में अगले सबसे संभावित शब्द की गणना करके वाक्य पूरा करते हैं। जब किसी खास विचार को व्यक्त करना होता है, तो मॉडल बार-बार उसी सबसे अनुकूल वाक्यांश जैसे डिपेंडेबल या दिस मैटर्स को चुन लेता है। • प्रॉम्प्ट और सुरक्षा फाइन-ट्यूनिंग का नतीजा: प्रयोगशालाएं मॉडल्स को तार्किक और संतुलित उत्तर देने के लिए प्रशिक्षित करती हैं, जिससे वे सीधे दावे करने से बचते हैं। इस वजह से वे मे प्रोवाइड या रदर दैन रिलाइंग ऑन जैसी सुरक्षात्मक और सुधारात्मक भाषा का अत्यधिक उपयोग करने लगते हैं। • पुराने संकेतों को जबरन दबाना: जब शोधकर्ताओं ने एम-डैश और डेलव जैसे शब्दों को हटाने के लिए मॉडल्स को कड़े निर्देश दिए, तो सिस्टम ने उनके विकल्प के रूप में नए वाक्य विन्यास अपना लिए। एक विसंगति को ठीक करने से दूसरी नई भाषाई आदत अपने आप पैदा हो गई। • पैरामीटर के विशाल आकार की सीमाएं: सैकड़ों अरबों पैरामीटर्स वाली प्रणालियों में हर छोटे भाषाई पैटर्न का परीक्षण करना संभव नहीं होता। सीमित परीक्षणों के कारण नए तकियाकलाम डेवलपर्स की नजर से बचकर अंतिम रिलीज में शामिल हो जाते हैं। सवाल-जवाब 1. ग्रेफाइट के अध्ययन में एआई की लिखावट को कैसे परिभाषित किया गया? शोधकर्ताओं ने ऐसे किसी भी मुहावरे या शब्द को टेल माना जो इंसानी लेखों की तुलना में एआई की सामग्री में कम से कम दोगुना अधिक देखा गया। 2. क्लॉड ओपस 5.5 का सबसे पसंदीदा शब्द कौन सा पाया गया? क्लॉड ओपस 5.5 में डिपेंडेबल शब्द का उपयोग इंसानी लेखन की तुलना में 23 गुना अधिक बार दर्ज किया गया। 3. ओपनएआई के एस्ट्रा मॉडल में कौन सी वाक्य संरचना सबसे ज्यादा देखी गई? एस्ट्रा में सुधारात्मक वाक्य संरचना जैसे नॉट सिंपली एक्स या रदर दैन रिलाइंग ऑन इंसानों से 100 गुना अधिक बार पाई गई। 4. एम-डैश के इस्तेमाल को लेकर मॉडल्स में क्या बदलाव आया है? ओपस 5.5 ने 99 प्रतिशत और एस्ट्रा ने 88 प्रतिशत तक एम-डैश कम कर दिया है, जबकि जेमिनी 3.1 प्रो ने इसे लगभग समाप्त कर दिया है। 5. क्या एआई के लेखन संकेत समय के साथ पूरी तरह खत्म हो रहे हैं? शोध के अनुसार पुराने संकेत हटाए जाने के बाद नए संकेत उभर आते हैं, जिससे इन पहचान चिह्नों की कुल संख्या लगभग स्थिर बनी हुई है। https://trendkia.com/ai/artificial-intelligence-ki-nai-bhasha-shaili-men-chhipe-hain-pakare-jane-ke-snketa-claude-aura-gpt-para-shodha-men-khulasa-41499 TrendKia — Har trend, sabse pehle.