सोशल मीडिया पर किमी के३ की चर्चा इस प्रकार हुई जैसे क्लॉड फेबल ५ का युग समाप्त हो गया हो। २.८ ट्रिलियन पैरामीटर का ओपन मॉडल, कोडिंग एरिना पर पहला स्थान, तथा उच्च क्षमता अंक।
प्रश्न यह है कि क्या के३ वास्तव में फेबल ५ का विकल्प है?
नहीं। समग्र क्षमता के मामले में ऐसा नहीं है। स्वयं मूनशॉट स्वीकार करता है कि के३ अभी भी क्लॉड फेबल ५ और जीपीटी-५.६ सॉल से पीछे है। स्वतंत्र मूल्यांकन बोर्ड इसे ओपस-श्रेणी के निकट रखते हैं, फेबल से ऊपर नहीं। यद्यपि कुछ कोडिंग बोर्ड्स पर इसका प्रदर्शन उत्कृष्ट है, फिर भी लागत, गति और उत्तर की लंबाई के मामले में यह पूरी तरह मुफ़्त सुविधा नहीं है।
नीचे निष्पक्ष आंकड़े दिए गए हैं: आधिकारिक दावे बनाम स्वतंत्र मूल्यांकन।
किमी के३ वास्तव में क्या है
[मूनशॉट के लॉन्च लेख](P०) के अनुसार:
- कुल २.८ ट्रिलियन पैरामीटर, ओपन ३टी-श्रेणी में स्थान
- स्टेबल लेटेंटएमओई: ८९६ विशेषज्ञ, प्रति टोकन १६ सक्रिय
- किमी डेल्टा अटेंशन (केडीए) और अटेंशन रेज़िडुअल्स लंबी अनुक्रमों के लिए
- मूल मल्टीमोडल पाठ और छवि इनपुट
- १,०४८,५७६ टोकन संदर्भ सीमा
- किमी के२ की तुलना में लगभग २.५ गुना दक्षता
लॉन्च एपीआई दरें: $०.३० / १एम कैश-हिट इनपुट, $३.०० / १एम कैश-मिस इनपुट, $१५.०० / १एम आउटपुट।
स्वतंत्र मूल्यांकन (तटस्थ आंकड़े)
आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स
[आर्टिफिशियल एनालिसिस](P१) द्वारा प्रस्तुत तटस्थ रिपोर्ट:
| मेट्रिक | रिपोर्टेड मान (एए) | नोट्स |
|---|---|---|
| इंटेलिजेंस इंडेक्स v४.१ | ५७ | रैंकिंग में लगभग #४ / १८६ |
| आउटपुट गति | ~३६.९ टोकन/सेकंड | अन्य समकक्षों की तुलना में धीमी गति |
| इनपुट / आउटपुट कीमत | $३ / $१५ प्रति १एम टोकन | कैश-हिट इनपुट $०.३० |
| मूल्यांकन शब्दबहुलता | ~१३०एम आउटपुट टोकन | औसतन ६३एम से अधिक आउटपुट टोकन |
| संदर्भ विंडो | १एम टोकन | पाठ और छवि इनपुट |
| कुल मूल्यांकन लागत | लगभग $२.७के | टोकन की अधिक खपत से लागत में वृद्धि |
यह मूल्यांकन के३ को क्लॉड ओपस ४.८ और जीपीटी-५.५ के निकट तथा क्लॉड फेबल ५ एवं जीपीटी-५.६ सॉल के पीछे रखता है।
एलएमअरेना फ्रंटएंड कोड एरिना
के३ ने एलएमअरेना फ्रंटएंड कोड एरिना पर #१ स्थान (१६७९ एलो) प्राप्त किया, जो फ्रंटएंड कोडिंग के लिए एक मजबूत संकेत है।
आधिकारिक कोडिंग स्कोर (मूनशॉट द्वारा प्रस्तुत)
| बेंचमार्क | किमी के३ | विवरण |
|---|---|---|
| टर्मिनल-बेंच २.१ | ८८.३ | एजेंटिक टर्मिनल कार्य |
| फ्रंटियरएसडब्ल्यूई | ८१.२ | जटिल सॉफ्टवेयर इंजीनियरिंग |
| प्रोग्रामबेंच | ७७.८ | प्रोग्राम पुनर्निर्माण |
| डीपएसडब्ल्यूई | ६७.५ | बहु-रिपॉ बग निवारण |
| एसडब्ल्यूई मैराथन | ४२.० | दीर्घकालिक प्रोजेक्ट कार्य |
ध्यान रखने योग्य बातें: १. प्रोग्राम पुनर्निर्माण में ७७.८% सफलता परीक्षण-स्तर पर है, संपूर्ण प्रोग्राम के संदर्भ में नहीं। २. के३ पिछले संदर्भ इतिहास (सोच इतिहास) के प्रति संवेदनशील है; इतिहास हटने से गुणवत्ता प्रभावित हो सकती है।
लागत और गति का विश्लेषण
- उच्च बौद्धिकता सूचकांक, किन्तु धीमी गति (~३७ टोकन/सेकंड)।
- जटिल प्रश्नों पर लंबे उत्तर (अधिक टोकन की खपत)।
- कैश का पुनः उपयोग अत्यंत महत्वपूर्ण है: पुनः प्रयुक्त संदर्भ पर $०.३० बनाम $३.०० इनपुट (१० गुना अंतर)।
किसे यह मॉडल चुनना चाहिए
उपयोगी है यदि आप:
- बड़े कोडबेस पर दीर्घकालिक कोडिंग एजेंट चलाना चाहते हैं।
- ओपन-वेट्स मॉडल के साथ उच्च गुणवत्ता चाहते हैं।
- फ्रंटएंड तथा यूआई विकास पर ध्यान केंद्रित कर रहे हैं।
उपयुक्त नहीं है यदि आप:
- त्वरित और सस्ती चैट प्रतिक्रियाएँ चाहते हैं।
- स्पष्ट निर्देशों के बिना काम करने वाले स्वायत्त एजेंटों पर भरोसा नहीं करते।
निष्कर्ष
किमी के३ ने कोई नया वैश्विक रिकॉर्ड नहीं बनाया है, लेकिन इसने ओपन और क्लोज्ड मॉडलों के बीच के अंतर को कम कर दिया है। यह फेबल ५ का पूर्ण विकल्प नहीं है, लेकिन ओपन-सोर्स क्षेत्र में एक महत्वपूर्ण प्रगति है।
स्रोत एवं श्रेय
१. [किमी के३: ओपन फ्रंटियर इंटेलिजेंस](P२) : मूनशॉट एआई आधिकारिक घोषणा २. [आर्टिफिशियल एनालिसिस पर किमी के३](P३) : तटस्थ मूल्यांकन एवं आंकड़े ३. [एलएमअरेना लीडरबोर्ड](P४) : कोडिंग रैंकिंग
