आर्टिफिशियल इंटेलिजेंस द्वारा तैयार की गई सामग्री जब से डिजिटल दुनिया में व्यापक हुई है, आम पाठकों से लेकर भाषा विशेषज्ञों तक हर कोई ऐसी लिखावट को पहचानने के तरीके तलाश रहा है। शुरुआत के दिनों में अत्यधिक एम-डैश यानी बड़े विराम चिह्नों का प्रयोग या फिर डेलव जैसे खास अंग्रेजी शब्दों की भरमार मशीन निर्मित पाठ की साफ चुगली कर देती थी। हालांकि आधुनिक फ्रंटियर मॉडल्स के नए संस्करणों से पुरानी गलतियों को काफी हद तक दुरुस्त कर दिया गया है, मगर शोधकर्ताओं का कहना है कि मशीनी गद्य अभी भी कई अचेतन आदतों और अनूठे पैटर्न का शिकार है, जो इंसानी लिखावट से काफी अलग दिखाई देते हैं।
ग्रेफाइट के शोध में पकड़े गए तेरह हजार खास पैटर्न
मार्केटिंग फर्म ग्रेफाइट के एक नए अध्ययन में अग्रणी आर्टिफिशियल इंटेलिजेंस प्रणालियों के लिखने की आदतों का विस्तृत विश्लेषण किया गया है। शोध दल ने प्रत्येक मॉडल के पसंदीदा शब्दों और वाक्यों की बनावट का बारीकी से परीक्षण किया। परिणामों से पता चला कि भले ही एम-डैश जैसी पुरानी कमजोरियां खत्म कर दी गई हों, लेकिन यह मॉडल्स अब भी विरोधाभास दर्शाने वाली जटिल वाक्य संरचनाओं पर जरूरत से ज्यादा निर्भर करते हैं। सबसे चौंकाने वाली बात यह सामने आई कि मशीनी पहचान के संकेतों का दायरा बेहद विशाल है। ग्रेफाइट ने ऐसे 13,000 अलग-अलग वाक्यांशों की पहचान की है, जिनकी आवृत्ति इंसानी सामग्री की तुलना में कृत्रिम बुद्धिमत्ता वाले टेक्स्ट में कम से कम दोगुनी दर्ज की गई। शोधकर्ताओं ने इसी अंतर को मशीन का टेल या भेद खोलने वाला लक्षण माना है।
ग्रेफाइट के मुख्य एआई अधिकारी ग्रेग ड्रक ने अध्ययन के नतीजों पर टिप्पणी करते हुए स्पष्ट किया कि एंथ्रोपिक के क्लॉड मॉडल समय के साथ इंसानी शब्द वितरण के अधिक करीब पहुंच रहे हैं। इसके विपरीत ओपनएआई के जीपीटी आधारित मॉडल्स इंसानी लिखावट के स्वाभाविक सांख्यिकीय वितरण से और अधिक दूर होते जा रहे हैं, जिससे दोनों कंपनियों के भाषाई विकास में एक बड़ा अंतर देखने को मिलता है।
दस हजार पुराने आलेखों के आधार पर हुआ वैज्ञानिक परीक्षण
बड़े पैमाने पर आर्टिफिशियल इंटेलिजेंस के लेखन पैटर्न को समझने के लिए शोधकर्ताओं ने एक बेहद सावधानीपूर्वक वैज्ञानिक रूपरेखा तैयार की थी। ग्रेफाइट ने सबसे पहले चैटजीपीटी के सार्वजनिक लॉन्च से पूर्व प्रकाशित 10,000 प्रामाणिक लेखों का एक बड़ा संग्रह तैयार किया, जिसे इंसान द्वारा रचित नियंत्रण समूह के तौर पर इस्तेमाल किया गया। इसके बाद विभिन्न अग्रणी मॉडल्स से उन्हीं आलेखों के सारांश के आधार पर नए सिरे से लेख लिखवाए गए। इस पद्धति का मुख्य उद्देश्य मूल स्रोत के भाषाई पूर्वाग्रह को पूरी तरह समाप्त करना था। जब इंसानों और अलग-अलग मॉडल्स से एक ही विषय पर समानांतर सामग्री प्राप्त हो गई, तब शोधकर्ताओं ने यह मापा कि विशिष्ट शब्द, मुहावरे और व्यापक वाक्य विन्यास कितनी बार दोहराए गए हैं।
क्लॉड ओपस 5.5 और ओपनएआई एस्ट्रा के अलग-अलग तकियाकलाम
आंकड़ों के अनुसार, क्लॉड ओपस 5.5 का सबसे बड़ा भाषाई संकेत डिपेंडेबल यानी भरोसेमंद शब्द है। इंसानी लेखन की तुलना में यह शब्द क्लॉड ओपस 5.5 के गद्य में 23 गुना अधिक बार दर्ज किया गया। यद्यपि ओपस 5.5 अब उस पुरानी बनावट से बचता है जिसमें कहा जाता था कि यह एक्स नहीं है बल्कि वाई है, लेकिन अब वह किसी भी बात को पेश करते हुए यह कहने की प्रवृत्ति रखता है कि यह केवल एक एक्स से बढ़कर वाई है।
इसके अलावा ओपस 5.5 किसी भी विषय के महत्व को जरूरत से ज्यादा रेखांकित करने का आदी दिखता है। अध्ययन में पाया गया कि यह मॉडल दिस मैटर्स यानी यह बात मायने रखती है मुहावरे का उपयोग इंसानी गद्य से 116 गुना अधिक करता है। वहीं दूसरी ओर किसी विषय विशेष के महत्व को समझाने वाला वाक्यांश वाई एक्स मैटर्स सामान्य इंसानी लेखों की अपेक्षा 92 गुना अधिक बार इस्तेमाल हुआ।
दूसरी तरफ ओपनएआई के एस्ट्रा मॉडल के संकेत बिल्कुल भिन्न किस्म के हैं। एस्ट्रा अपने विवरणों में किसी भी विषय के अनदर डायमेंशन यानी एक अन्य पहलू का उल्लेख करने में अत्यधिक रुचि दिखाता है। साथ ही किसी दावे को सीधे तौर पर कहने के बजाय बचाव की मुद्रा में यह लिखने का आदी है कि कोई कदम किसी खास लाभ को प्रदान कर सकता है या उपलब्ध करा सकता है। एस्ट्रा का सबसे प्रमुख संकेत वह है जिसे ग्रेफाइट ने सुधारात्मक रूपरेखा का नाम दिया है। इसमें किसी विषय को केवल एक्स नहीं है कहकर परिभाषित किया जाता है या फिर एक्स पर निर्भर रहने के बजाय जैसा विकल्प पेश किया जाता है। शोध के अनुसार इस प्रकार के सुधारात्मक वाक्य इंसानों की तुलना में एस्ट्रा के लेखन में 100 गुना से भी अधिक सामान्य पाए गए।
एम-डैश पर सुधार लेकिन नए लक्षणों का निरंतर उभार
विराम चिह्नों के मामले में सभी फ्रंटियर शोध प्रयोगशालाओं ने इस आलोचना पर स्पष्ट रूप से प्रतिक्रिया दी है कि उनके सिस्टम एम-डैश का अत्यधिक प्रयोग करते थे। ग्रेफाइट के परीक्षणों में क्लॉड ओपस 5.5 ने पुराने ओपस 5 संस्करण की तुलना में एम-डैश का उपयोग 99 प्रतिशत तक घटा दिया। वहीं एस्ट्रा ने इंसानी नमूनों के मुकाबले इस विराम चिह्न का प्रयोग 88 प्रतिशत कम कर दिया है। जेमिनी 3.1 प्रो ने तो अपने लेखन से एम-डैश को लगभग पूरी तरह से बाहर ही कर दिया है।
विशिष्ट आदतों में बदलाव के बावजूद ग्रेफाइट का मानना है कि मशीनी पहचान के संकेतों की कुल संख्या में कोई खास कमी नहीं आई है। ग्रेग ड्रक ने बताया कि ऐसा बिल्कुल नहीं है कि ये लक्षण घट रहे हैं। कंपनियां सबसे ज्यादा चर्चित और बदनाम संकेतों को हटाने में तो सफल हो जाती हैं, लेकिन तुरंत ही उनकी जगह दूसरे लक्षण उभर आते हैं, और हर नए मॉडल संस्करण की अपनी एक नई शैलीगत कमजोरी सामने आ जाती है।
अरबों पैरामीटर्स के कारण जटिल बनी पूर्ण नियंत्रण की चुनौती
सभी बड़ी तकनीकी कंपनियों द्वारा प्राकृतिक लेखन शैली पर भारी जोर दिए जाने के बावजूद इन कमजोरियों का बना रहना विशेषज्ञों को हैरान करता है। जब ओपस 5.5 जारी किया गया था, तब एंथ्रोपिक ने दावा किया था कि यह मॉडल पिछले सभी संस्करणों की तुलना में कहीं अधिक स्वाभाविक तरीके से संवाद करता है और शुरुआती उपयोगकर्ताओं ने इसके लेखन को अधिक स्पष्ट तथा समझने में आसान पाया था। ठीक इसी प्रकार जब ओपनएआई ने जीपीटी-6 के सोल और लूना संस्करण पेश किए थे, तब उपयोगकर्ताओं को अधिक स्पष्टता, कम तकनीकी जटिलता और अजीबोगरीब मुहावरों से मुक्ति मिलने का भरोसा दिलाया गया था।
इसके बावजूद ड्रक इस बात को लेकर संशय में हैं कि ये प्रयोगशालाएं अपने सिस्टम से अस्वाभाविक मुहावरों या पकड़ में आने वाले ढांचों को पूरी तरह समाप्त कर पाएंगी। ड्रक का मानना है कि अरबों पैरामीटर्स वाले इन विशालकाय तंत्रों पर प्रयोगशालाओं का नियंत्रण लोगों की उम्मीद से कहीं कम हो सकता है। डेवलपर्स के पास परीक्षण करने के लिए केवल एक सीमित संख्या में ही जांच के साधन होते हैं, जिसके चलते कई सूक्ष्म भाषाई विकृतियां बिना पकड़ में आए बाहर निकल जाती हैं।



















