मैं अलग हो गया

FIRSTonline बैनर

लघु मॉडलों की ओर कृत्रिम बुद्धिमत्ता: क्या वर्तमान प्रणालियों की विशालता पर काबू पाना संभव है?

आर्टिफिशियल इंटेलिजेंस सिस्टम क्या हैं और वे स्मार्टफोन की कंप्यूटिंग शक्ति वाले उपकरणों के लिए कैसे काम करते हैं

लघु मॉडलों की ओर कृत्रिम बुद्धिमत्ता: क्या वर्तमान प्रणालियों की विशालता पर काबू पाना संभव है?

हम जानते हैं कि महान भाषाई मॉडलकृत्रिम बुद्धिमत्ता उन्हें अपने चैटबॉट्स के प्रदर्शन को बेहतर बनाने के लिए भारी मात्रा में डेटा की आवश्यकता होती है। हम यह भी जानते हैं कि तथाकथित माध्यम से सीखने को परिष्कृत करने के लिए उन्हें विशाल मानव संसाधनों की आवश्यकता होती है सुदृढीकरण सीखना. उत्तरार्द्ध वास्तव में, i के साथ होता है लोगों से प्रतिक्रिया जो विभिन्न विषयों पर उत्तरों का मूल्यांकन करते हैं।

ये दो शर्तें होनी चाहिए प्रतिक्रियाओं की सटीकता बढ़ाएँ मॉडल और त्रुटियों और मतिभ्रम को कम करें, जो दुर्भाग्य से, अभी भी अक्सर होते हैं। और अधिक डेटा का अर्थ है अधिक सटीकता। इसलिए ऐसे मॉडलों में विशालता की ओर जन्मजात प्रवृत्ति होती है।

विशालवाद जो मांग करता है विशाल कंप्यूटिंग शक्ति, अपस्ट्रीम, सीखने के चरण में और, डाउनस्ट्रीम, उन लाखों उपयोगकर्ताओं की सेवा करने के लिए जो उत्तर के लिए इसकी ओर रुख करते हैं। उदाहरण के लिए, इस साल मार्च में इसके 200 मिलियन सक्रिय उपयोगकर्ता थे ChatGPT. ऐसी कंप्यूटिंग शक्ति प्राप्त करने के लिए गणना के इतिहास में अभूतपूर्व उपकरणों, उपकरणों, सॉफ्टवेयर और ऊर्जा की उपलब्धता की आवश्यकता होती है।

इन पूर्व-आवश्यकताओं का मतलब है कि बड़ी सामान्य भाषाई प्रणालियों के निर्माण और रखरखाव के लिए निवेश की आवश्यकता होती है जिसे केवल कुछ बड़ी कंपनियां ही वहन कर सकती हैं। ऐसा अनुमान है कि अकेले 2004 की पहली तिमाही में ही मैं उच्च तकनीक दिग्गज (मेटा, माइक्रोसॉफ्ट, गूगल और अमेज़ॅन) ने खर्च किया है अरब डॉलर 32 एआई का समर्थन करने के लिए तकनीकी बुनियादी ढांचे में।

इसलिए इस क्षेत्र में नए खिलाड़ियों के प्रवेश में एक विकट बाधा है, जिसका अनुमान 2031 तक एक ट्रिलियन डॉलर का होगा।

नए मॉडलों की खोज

इसलिए, इसमें कोई आश्चर्य की बात नहीं है कि प्रवेश की इस बाधा को काफी हद तक कम करने के लिए काम किया जा रहा है। उदाहरण के लिए, डेटा ट्यूनिंग चरण में मानव उपस्थिति को पूरी तरह से समाप्त करने के लिए वैकल्पिक शिक्षण मॉडल विकसित करना। यह भी अनुमान लगाया गया है कि ये नए मॉडल वे तक हो सकते हैं सात गुना कम ऊर्जा गहन ओपनएआई और गूगल जेमिनी द्वारा उपयोग किए गए। यह अंतिम पहलू महत्वपूर्ण है क्योंकि एआई का विकास, अपने वर्तमान स्वरूप में, पर्यावरण पर नकारात्मक प्रभाव डालता है।

इनमें से एक मॉडल यूरोपीय स्टार्ट-अप द्वारा प्रस्तावित समाधान में पाया जा सकता है मिस्ट्रल और क्लाउड में भी, भाषाई मॉडल anthropic, डारियो अमोदेई द्वारा निर्देशित एक स्टार्ट अप। मैश किए हुए आलू लामा 3, जिसे मेटा लॉन्च करने की तैयारी कर रहा है, और चैटजीपीटी 5, जल्द ही जारी होने वाले हैं, इन नवोन्वेषी मॉडलों का उपयोग करें। हाल के दिनों में, अमेज़ॅन के शोधकर्ताओं ने सामान्य मॉडल से त्रुटियों और अवांछित डेटा को खरोंच से पुनर्जीवित किए बिना खत्म करने के लिए एक विधि (मॉडल डिस्गोर्जमेंट) प्रस्तुत की है।

हालाँकि, वास्तविकता में, सबसे विघटनकारी नवाचार कृत्रिम बुद्धिमत्ता की पेशकश की समस्या के लिए एक अलग प्रकार का दृष्टिकोण है। यह उस दृष्टिकोण के समान है जो छोटे मॉड्यूलर रिएक्टरों के साथ परमाणु ऊर्जा के क्षेत्र में उभर रहा है (एसएमआर).

हम एआई सिस्टम की बात कर रहे हैं जो छोटे, विशिष्ट और बनाने और बनाए रखने में कम महंगे हैं। ये मॉडल हो सकते हैं उपकरणों की एक विस्तृत श्रृंखला पर उपयोग किया जाता है जैसे कि स्मार्टफोन, कैमरा और सेंसर, इस प्रकार आपको उन उपयोगकर्ताओं तक पहुंचने की अनुमति मिलती है, जैसे छोटी कंपनियां और पेशेवर जो बड़े मॉडल नहीं खरीद सकते। इसके अलावा, चूँकि उन्हें कार्य करने के लिए क्लाउड या इंटरनेट कनेक्शन की आवश्यकता नहीं होती है, वे गोपनीयता, डेटा सुरक्षा और कॉपीराइट की महत्वपूर्ण समस्या का पहला समाधान प्रदान करते हैं।

इस सप्ताह, माइक्रोसॉफ्ट e Apple उन्होंने क्रमशः लॉन्च किया फ़ि-3 e ओपनईएलएम, भाषा मॉडल के दो परिवार जो उन मॉडलों की तुलना में अधिक सीमित कंप्यूटिंग संसाधन का उपयोग करते हैं जिन्हें हम पहले से जानते हैं। और इससे भी दिलचस्प बात यह है कि दोनों परिवारों का कोड सार्वजनिक डोमेन में है।

माइक्रोसॉफ्ट का Phi-3 परिवार

उन्होंने कहा, "फी श्रृंखला में हम जो दृष्टिकोण अपना रहे हैं वह बाकी उद्योग द्वारा मांगे गए दृष्टिकोण से अलग है जो मुख्य रूप से अधिक डेटा जोड़ने और इस प्रकार मॉडल को बड़ा बनाने के उद्देश्य से आवर्धन पर ध्यान केंद्रित करता है।" सेबेस्टियन बुबेक, माइक्रोसॉफ्ट में जनरेटिव आर्टिफिशियल इंटेलिजेंस रिसर्च के उपाध्यक्ष, "सेमाफ़ोर" पत्रिका के कात्याना क्वाच को, जो कि "न्यूयॉर्क टाइम्स" के पूर्व स्तंभकार बेन स्मिथ द्वारा 2022 में स्थापित एक वैश्विक ऑनलाइन समाचार पत्र है।

Microsoft के लिए, छोटे मॉडलों में निवेश करना ग्राहकों को OpenAI के साथ साझेदारी से पैदा हुए बड़े सिस्टम की तुलना में अधिक विकल्प प्रदान करने के लिए समझ में आता है। जो लोग उस श्रेणी में मॉडल का उपयोग करने में सक्षम नहीं हैं, वे Phi-3 मिनी जैसे छोटे विकल्पों का सहारा ले सकते हैं।

माइक्रोसॉफ्ट ने प्रयोग किया वास्तविक डेटा का मिश्रण वेब से उद्धरण ई सिंथेटिक डेटा Phi-3 परिवार सेटों को प्रशिक्षित करने के लिए AI द्वारा ही तैयार किया गया।

" यही कारण है कि Phi-3 इतना अच्छा है इसके आकार के कारण - ब्यूबेक ने कहा - ऐसा इसलिए है क्योंकि हमने डेटा को अधिक सावधानी से संसाधित किया है। इसका मतलब यह है कि शिक्षण सामग्री की गुणवत्ता और सटीकता सुनिश्चित करने के लिए मॉडल को प्रशिक्षित करने के लिए उपयोग किए गए पाठ को स्रोत पर जांचा और चुना गया है।

सिएटल कंपनी के अनुसार, Phi-3 का प्रदर्शन ओपन AI के मुफ्त संस्करण ChatGPT 3.5 के समान है।

Apple का OpenELM परिवार

एक समान दर्शन अदिश परिवार को सूचित करता है एप्पल का ओपनईएलएम. इसकी विशेषता यह है कि यह कर सकता है iPhone संसाधनों के साथ कार्य करें और क्यूपर्टिनो कंपनी के अन्य उपकरणों पर प्रदर्शन और सिस्टम आवश्यकताओं के बीच संतुलन के लिए धन्यवाद। डिवाइस पर होने वाले डेटा और प्रसंस्करण के साथ, OpenELMa को स्थानीय रूप से चलाने के लिए यह संतुलन आवश्यक है।

ओपनईएलएम के मामले में भी डेवलपर्स की पसंद पर असर पड़ा उपयोग किए गए पाठ और डेटा की गुणवत्ता मॉडल को प्रशिक्षित करने के लिए. Apple टीम ने भाषाई संरचनाओं और प्राकृतिक भाषा शब्दावली की जटिलता को संरक्षित करने और मॉडल में स्थानांतरित करने का प्रयास करते हुए, सार्वजनिक डेटासेट से पाठ को फ़िल्टर किया।

हालाँकि Apple ने अभी तक Open ELM को अपने उपकरणों में एकीकृत नहीं किया है, लेकिन ऐसा माना जाता है कि यह अगला है आईओएस अपडेट (18वीं, जून की शुरुआत में ग्लोबल डेवलपर कॉन्फ्रेंस में अपेक्षित) इसमें सिरी में सुधार और ऐप्स में सारांश और स्वत: पूर्ण सुविधाएं शामिल होंगी। इन नए प्रदर्शनों को iPhone 16 पर बेहतर प्रदर्शन करना चाहिए जो इन कार्यों के लिए नए, अधिक शक्तिशाली और अनुकूलित M4 चिप से लैस होगा।

छोटे मॉडलों का अनुपात

सभी उपयोगकर्ताओं को सैकड़ों दस्तावेज़ों या वैज्ञानिक अनुसंधानों का विश्लेषण करने में सक्षम सबसे उन्नत या अत्याधुनिक भाषा मॉडल की आवश्यकता नहीं है। के लिए कई विशिष्ट कार्य, छोटे मॉडल अच्छा काम कर सकते हैं कुशलतापूर्वक, शीघ्रता से और आर्थिक रूप से।

बेंचमार्किंग परीक्षणों में, फ़ि-मिनीचैटजीपीटी-3,8 के 175 बिलियन की तुलना में 3.5 बिलियन मापदंडों से बना, इसका प्रदर्शन बाद वाले से महत्वपूर्ण रूप से भिन्न नहीं है।

Apple के OpenELM मॉडल और भी छोटे हैं: उनकी सीमा 270 मिलियन से 3 बिलियन पैरामीटर के बीच है। Apple समाधान के लघु आयाम को समझने के लिए, बस इस बात पर विचार करें कि मेटा का नया लामा 3 मॉडल, जिसे छोटी श्रेणी में वर्गीकृत किया जा सकता है, 8 बिलियन मापदंडों से बना है।

Apple के OpenELM परिवार का औसत संस्करण, जिसमें एक अरब से अधिक पैरामीटर हैं, कम डेटा के साथ प्रशिक्षित होने के बावजूद तुलनात्मक आकार के मॉडल से बेहतर प्रदर्शन करता प्रतीत होता है।

खुली प्रणालियों का चयन

कृत्रिम होशियारी स्मार्टफ़ोन पर इसका अभी तक कोई बड़ा प्रभाव नहीं पड़ा है और प्रौद्योगिकी कंपनियां संभावनाएं तलाशने के लिए तेजी से आगे बढ़ रही हैं। यह देखने का कोई बेहतर तरीका नहीं है कि कौन से नए एआई उत्पाद और ऐप्स डेवलपर प्रयोग के लिए खोलकर बनाए जा सकते हैं।

यही कारण है कि अपनी तकनीक को लेकर बेहद गोपनीय रहने वाले एप्पल ने भी इसे जारी कर दिया है स्रोत कोड और प्रशिक्षण निर्देश इसके OpenELM सिस्टम के लिए।

एक पेपर में, ऐप्पल शोधकर्ताओं ने बताया कि कृत्रिम बुद्धिमत्ता को आगे बढ़ाने और इसके संभावित पूर्वाग्रहों और जोखिमों की जांच करने के लिए एलएलएम की प्रतिलिपि प्रस्तुत करने योग्यता और पारदर्शिता महत्वपूर्ण है।

क्या ये छोटे मॉडल वास्तव में वैध हैं?

इस बिंदु पर किसी को आश्चर्य होता है कि क्या लघु एआई वास्तव में अच्छा विचार है। दुर्भाग्य से, मैं बेंचमार्क और परीक्षण का उपयोग किया गया कृत्रिम बुद्धि के प्रदर्शन का मूल्यांकन करने के लिए वे हमेशा विश्वसनीय नहीं होते और उनकी सटीक तुलना करना कठिन है।

यह के मुख्य निष्कर्षों में से एक हैनवीनतम "एआई इंडेक्स" रिपोर्ट स्टैनफोर्ड यूनिवर्सिटी से. "सेमाफ़ोर" अनुसंधान के प्रमुख के एक बयान की रिपोर्ट करता है, नेस्टर मास्लेज, जिसमें कहा गया है कि कुछ बेंचमार्क यह नहीं दर्शाते हैं कि लोग वास्तव में चैटबॉट्स का उपयोग कैसे करते हैं। उद्योग जगत गणित की समस्याओं को हल करने में उनकी दक्षता का परीक्षण कर रहा है।

लेकिन अधिकांश उपयोगकर्ता गणितीय समीकरणों को हल करने के तरीके के बारे में ज्यादा परवाह नहीं करते हैं और पहले स्थान पर अधिक सटीक मॉडल को प्राथमिकता देंगे।

. . .

स्त्रोत:

  • कात्याना क्वाच, माइक्रोसॉफ्ट, एप्पल छोटे एआई मॉडल के साथ बड़ा कदम उठाना चाहते हैं, "सेमाफ़ोर", 26 अप्रैल, 2024
  • केट ओ'फ़्लाहर्टी, नया iOS 18 AI सुरक्षा कदम सभी iPhone उपयोगकर्ताओं के लिए गेम में बदलाव करता है, "फोर्ब्स," 29 अप्रैल, 2024
  • करेन वीज़ और कैड मेट्ज़, माइक्रोसॉफ्ट ने छोटे एआई सिस्टम में एक नया कदम उठाया, "द न्यूयॉर्क टाइम्स," 23 अप्रैल, 2024
  • कात्याना क्वाच, 'डिसगॉर्जमेंट': अमेज़ॅन के शोधकर्ता खराब एआई डेटा से छुटकारा पाने के तरीके सुझाते हैं, "सेमाफोर," 1 मई, 2024
  • करेन वीज़, एआई बनाने की दौड़ में, टेक एक बड़े प्लंबिंग अपग्रेड की योजना बना रहा है, "द न्यूयॉर्क टाइम्स," 27 अप्रैल, 2024
  • केविन रूज़, एआई हैज़ ए मेजरमेंट प्रॉब्लम, "द न्यूयॉर्क टाइम्स," 15 अप्रैल, 2024
  • मधुमिता मुर्गिया और क्रिस्टीना क्रिडल, ओपनएआई और मेटा ने 'तर्क' करने में सक्षम नए एआई मॉडल तैयार किए, "द फाइनेंशियल टाइम्स", 9 अप्रैल 2024

समीक्षा