कृत्रिम बुद्धिमत्ता यानी AI से बातचीत का तरीका अब सिर्फ आवाज या टेक्स्ट तक सीमित नहीं रह गया है। गूगल ने अपने लोकप्रिय जेमिनी प्लेटफॉर्म के लिए एक बड़ा अपडेट पेश करते हुए जेमिनी 3.8 लाइव विद लाइव अवतार लॉन्च किया है। इस नई तकनीक की मदद से अब यूजर्स को सिर्फ कंप्यूटर की आवाज नहीं सुनाई देगी, बल्कि स्क्रीन पर एक डिजिटल इंसान भी दिखेगा। यह अवतार न केवल आपकी बात सुनेगा और स्क्रीन पर देखेगा, बल्कि पलक झपकते ही वीडियो और आवाज के माध्यम से आपको जवाब भी देगा।
बातचीत का अधिक प्राकृतिक अनुभव
गूगल के नए लाइव अवतार फीचर को इस तरह से बनाया गया है कि इसके साथ की जाने वाली बातचीत बिल्कुल वैसी ही लगे जैसे दो लोग आपस में कर रहे हों। बातचीत के दौरान यह डिजिटल कैरेक्टर अपने चेहरे के हाव-भाव बदल सकता है। इसकी सबसे बड़ी खूबी यह है कि जब यह बोलेगा, तो इसके होंठों की हलचल यानी लिप सिंक पूरी तरह से आवाज के साथ तालमेल में रहेगी। इस तकनीक का उद्देश्य AI के साथ इंसानी बातचीत को और भी अधिक इंटरैक्टिव और व्यावहारिक बनाना है।
बिजनेस और एंटरप्राइज के लिए खास फीचर्स
जेमिनी 3.8 लाइव विद लाइव अवतार को विशेष रूप से व्यावसायिक जरूरतों को ध्यान में रखकर तैयार किया गया है। वर्तमान में यह नया विकल्प जेमिनी एंटरप्राइज के ग्राहकों के लिए उपलब्ध कराया गया है। कंपनियां इसका इस्तेमाल विभिन्न क्षेत्रों में कर सकती हैं, जैसे कि कस्टमर सपोर्ट को बेहतर बनाना, डिजिटल वर्चुअल असिस्टेंट के रूप में काम लेना या किसी नए प्रोडक्ट और सर्विस का लाइव डेमो ग्राहकों को दिखाना।
इस सिस्टम की एक मुख्य विशेषता यह है कि यह एक ही समय में ऑडियो और वीडियो दोनों इनपुट को प्रोसेस कर सकता है। इसका मतलब यह है कि यूजर जो बोल रहा है और स्क्रीन पर जो कुछ भी दिख रहा है, यह AI मॉडल उन दोनों को एक साथ समझ सकता है। दोनों इनपुट का विश्लेषण करने के बाद, यह अपनी आवाज, चेहरे के एक्सप्रेशन और वीडियो के माध्यम से सटीक उत्तर तैयार करता है।
एसिंक्रोनस टूल कॉलिंग और 97 भाषाओं का सपोर्ट
बातचीत को बिना किसी रुकावट के जारी रखने के लिए गूगल ने इसमें एसिंक्रोनस टूल कॉलिंग की सुविधा दी है। आसान शब्दों में कहें तो, अगर बातचीत के दौरान AI को बैकग्राउंड में कोई जानकारी सर्च करनी है या कोई काम पूरा करना है, तो उसे बातचीत रोकने की जरूरत नहीं पड़ेगी। वह यूजर से नॉर्मल बातचीत जारी रखते हुए ही पीछे अपना काम पूरा कर लेगा, जिससे यूजर को लंबा इंतजार नहीं करना पड़ता।
इसके अलावा, ग्लोबल मार्केट को ध्यान में रखते हुए इस तकनीक में भाषाओं का बड़ा सपोर्ट दिया गया है। यह लाइव अवतार फीचर कुल 97 भाषाओं को सपोर्ट करता है। अगर बातचीत के दौरान यूजर अपनी भाषा बदलता है, तो यह डिजिटल अवतार तुरंत अपनी आवाज के साथ-साथ अपने होंठों की मूवमेंट और चेहरे के एक्सप्रेशन को भी उस नई भाषा के उच्चारण के हिसाब से ढाल लेता है।
कस्टम अवतार और सुरक्षा के उपाय
इस प्लेटफॉर्म का इस्तेमाल करने वाली कंपनियां अपनी पसंद के अनुसार पहले से तैयार किए गए कई अवतारों और विभिन्न आवाजों में से चुनाव कर सकती हैं। इसके अलावा, संगठनों के पास अपना खुद का कस्टम अवतार बनाने का विकल्प भी होगा। इसके लिए कंपनी को अपनी हाई-क्वालिटी इमेज देनी होगी, जिसके आधार पर सिस्टम उसी ब्रांड के लुक और स्टाइल से मैच करता हुआ एक जीवंत डिजिटल एनिमेटेड अवतार तैयार कर देगा।
हालांकि, खुद का कस्टम अवतार बनाने की यह विशेष सुविधा अभी केवल चुनिंदा एंटरप्राइज ग्राहकों तक ही सीमित रखी गई है। सुरक्षा को ध्यान में रखते हुए और AI द्वारा तैयार किए गए वीडियो कंटेंट की पहचान को आसान बनाने के लिए, गूगल ने इसमें अपनी खास सिंथआईडी तकनीक का इस्तेमाल किया है। यह तकनीक वीडियो पर एक अदृश्य वॉटरमार्क लगा देती है, जिससे यह आसानी से पता चल जाता है कि इसे AI की मदद से बनाया गया है।




















