थोडक्यात उत्तर: CLM-8B हे एजंटच्या जलद निर्णयांसाठी बनवलेले एक ओपन कॉन्ट्रास्टिव्ह लँग्वेज मॉडेल , आणि त्याच्या निर्मात्यांच्या दाव्यानुसार जेव्ह-क्लास समकक्ष मॉडेल्सच्या तुलनेत याची लेटन्सी सुमारे ९ पट कमी आहे. रिलीज सेटअपच्या बाहेर हे आकडे अद्याप अपुष्ट आहेत. जर तुम्ही कोडिंग एजंट्स तयार करत असाल, तर चार्ट्सवर विश्वास ठेवण्यापूर्वी तुमच्या स्वतःच्या हार्नेसवर त्याची A/B चाचणी करा.
महत्वाचे मुद्दे:
लेटन्सी दावे: जोपर्यंत इतरजण याची पुनरावृत्ती करत नाहीत, तोपर्यंत जेव्हच्या ~९ पट वेगवाढीला लेखकाने नोंदवलेली माहिती माना.
इव्हॅल हार्नेस: CLM-8B ची A/B चाचणी करताना होल्ड टूल्स आणि प्रॉम्प्ट्स निश्चित केलेले असतात.
हायब्रीड स्टॅक: हॉट लूपसाठी सीएलएम वापरा; नवीन कार्यांसाठी धीमा रीझनर ठेवा.
ओपन वेट्स: व्यावसायिक फोर्क पाठवण्यापूर्वी अपाचे लायसन्स फाइल्सची पुष्टी करा.
गैरवापराचा धोका: एजंट काही मिलिसेकंदांमध्ये निर्णय घेत असताना उलटवता येणारी साधने आणि गुपिते बंद करा.
CLM-8B काय बनण्याचा प्रयत्न करत आहे ⚡
या पद्धतीचा प्रचार करणाऱ्या लोकांच्या वर्णनानुसार, कॉन्ट्रास्टिव्ह लँग्वेज मॉडेल प्रशिक्षण हे केवळ पुढील टोकनची शक्यता वाढवण्याऐवजी, अवस्था आणि कृती यांना जोडण्याबद्दल आहे. सोप्या शब्दांत सांगायचे तर: एखाद्या कादंबरीकारापेक्षा धोरणकर्त्याप्रमाणे, 'ही आहे परिस्थिती'ला 'ही आहे पुढची चाल' याच्याशी जोडण्यासाठी मॉडेलला प्रवृत्त केले जाते. संशोधक सतत सिस्टीम १ च्या उपमेचा आधार घेतात - वेगवान, सहयोगी, निर्णय-आधारित - याउलट सिस्टीम २ चा सूर हा विचारांच्या लांबलचक साखळीचा असतो, ज्यात मोठ्याने विचार करताना टोकन्स वाया जातात.
CLM-8B हा त्या मालिकेतील पहिला सार्वजनिक वेट सेट आहे. याला एक ओपन रिसर्च रिलीज म्हणून सादर केले आहे, ज्यामध्ये या रिलीजसोबत आलेल्या कव्हरेजवर अपाचे २.० लायसन्सिंग लागू आहे. जर तुम्हाला वकिलांच्या त्रासाशिवाय यात सुधारणा करायची असेल, ते इतरांना पाठवायचे असेल किंवा त्याची एक प्रत (फोर्क) तयार करायची असेल, तर ही बाब महत्त्वाची ठरते. जॅकी क्वोक यांनी या कामाची ओळख करून दिली; स्टॅनफोर्डशी संबंधित असलेल्या अझालिया मिर्होसेनी यांनी याला अधिक प्रसिद्धी दिली; आणि या सर्वांच्या व्यापक मांडणीतून हे स्टॅनफोर्ड आणि एनव्हिडिया यांच्यातील सांघिक प्रयत्न असल्याचे दिसून येते. यात संशोधकांची नावे आहेत, वेट्स सार्वजनिक आहेत, कोड ओपन आहे - ही काही अनामिक गळती नाही. तिसऱ्या पक्षाकडून याची प्रतिकृती तयार होण्यासाठी अजून खूप लवकर आहे, त्यामुळे संशयाची पातळी "मनोरंजक" आणि "मला स्वतंत्र मंडळ दाखवा" या दोन टोकांच्या दरम्यान ठेवा.
याचा आकार आठ अब्ज पॅरामीटर्सचा आहे, जो इतका लहान आहे की लॅब्स आणि स्वतंत्र निर्माते H100 वेळेसाठी मोठी किंमत न मोजता ते होस्ट करू शकतात. यानंतर येणाऱ्या मोठ्या CLM-35B . हे मोठे मॉडेल लेटन्सीची समस्या कायम ठेवेल की वेगाच्या बदल्यात डेप्थ देईल, हे अद्याप निश्चित नाही, परंतु रोडमॅपमधील संकेत स्पष्ट आहे: हे एक संपूर्ण कुटुंब असणार आहे, केवळ एक प्रात्यक्षिक कार्ड नाही.
- लक्ष्य: एजंटसाठी स्थिती → कृती लूप, निबंध लेखन नव्हे
- रिलीझच्या संदर्भातील वृत्तांकनात परवाना देण्याला अपाचे २.० असे संबोधण्यात आले
- शैली: प्रणाली १ / निर्णय-केंद्रित प्रशिक्षण कथा
- पुढील: मोठ्या CLM-35B चा एक योजना म्हणून उल्लेख
सिस्टम १ स्टाईल विरुद्ध नेहमीची टोकन ट्रेडमिल
तुम्हाला माहीत असलेले बहुतेक प्रोडक्शन एलएलएम (LLMs) एका वेळी एक टोकन याप्रमाणे मजकूर तयार करतात. हे गद्य, कोड डम्प्स आणि तर्काच्या काळजीपूर्वक केलेल्या विश्लेषणांसाठी उत्तम काम करते. यामुळेच, मॉडेल 'स्मार्ट' असूनही, ज्या एजंटला प्रति मिनिट वीस सूक्ष्म-निर्णयांची आवश्यकता असते तो मंद वाटू शकतो. प्रत्येक टप्प्यावर ऑटोरेग्रेसिव्ह टॅक्स लागतो.
कॉन्ट्रास्टिव्ह लँग्वेज मॉडेल (Contrastive Language Model) भर देण्याची पद्धत बदलते. नेटवर्कला कथन करत उत्तर देण्यास सांगण्याऐवजी, तुम्ही त्याला दिलेल्या स्थितीनुसार योग्य कृतीला प्राधान्य देण्यासाठी प्रशिक्षित करता - केवळ ओघवती वाक्यरचना नव्हे, तर चांगल्या आणि वाईट कृतींमधील विरोधाभासी फरकाचा विचार करा. निर्मात्यांना हा नमुना आधीच माहीत असतो: कधीकधी तुम्हाला हजार शब्दांच्या स्पष्टीकरणाची गरज नसते; तुम्हाला फक्त मॉडेलने ' rm -rf' ऐवजी 'pytest' टाईप करावे एवढीच गरज असते . वेगवान लूप्सना हा फरक महत्त्वाचा वाटतो.
याचा अर्थ असा नाही की CLM-8B मजकूर प्रसारित करू शकत नाही. याचा अर्थ असा आहे की प्रशिक्षणाचे उद्दिष्ट आणि मूल्यमापनाची प्रक्रिया ही एजेंटिक नियंत्रणाकडे झुकलेली आहे. हे "चॅट मॉडेल जे टूल-कॉल देखील करू शकते" यापेक्षा वेगळ्या प्रकारचे उत्पादन आहे. उद्योगाने अनेक वर्षे मॉडेल्सना टूल्सबद्दल अधिक चांगल्या प्रकारे संवाद साधण्यासाठी बनवले आहे, पण तरीही प्रत्यक्ष संवाद साधण्यातच अडथळा येत आहे. निर्णयाला प्राधान्य देणारे मॉडेल हे एक असे बाजूचे पाऊल आहे, जे एकतर नंतर विचार केल्यावर स्पष्ट दिसते किंवा जेव्हा निकष एकमेकांत गुंततात तेव्हा अयशस्वी ठरते. दोन्ही परिणाम शक्य आहेत.
दावा केलेला वेग आणि बेंचवरील आकडे (दावे म्हणून विचारात घ्या)
सोशल मीडियावर चर्चेला चालना देणारा भाग हा आहे: प्रवर्तकांचा दावा आहे की, जेव्ह-क्लास मॉडेल्सच्या तुलनेत इन्फरन्स सुमारे ९ पट अधिक जलद आहे. हलक्या फाइन-ट्यूनिंगनंतर, त्यांनी एजेंटिक कोडिंगचे उत्तम परिणामही नोंदवले आहेत - डीपएसडब्ल्यूईमध्ये सुमारे ८१.६% यश आणि टर्मिनल-बेंच २.१ मध्ये सुमारे ८७.६%. काही मूल्यांकनांमध्ये, त्यांनी झिरो-शॉट परफॉर्मन्स जेव्हच्या तुलनेत असल्याचे वर्णन केले आहे, तर लेटन्सी खूपच कमी राहते. रिलीजच्या चर्चेदरम्यान समोर आलेल्या एका क्लस्टर सारांशामध्ये टर्मिनल बेंच सेटिंगवर अंदाजे ३२ मिलिसेकंद-क्लास रिस्पॉन्स टाइमचा उल्लेख होता. हे काळजीपूर्वक मांडा: या लेखात हे केवळ नोंदवलेले आणि दावा केलेले आहे, स्वतंत्रपणे तपासलेले नाही.
जर हे लेटन्सीचे आकडे सर्वसाधारणपणे लागू होत असतील, तर व्यावहारिक फायदा म्हणजे प्रत्येक एकाच वेळी चालणाऱ्या एजंटसाठी कमी जीपीयू वापरणे, किंवा प्रत्येक जीपीयूमागे अधिक एजंट वापरणे. शेलवर सतत काम करणाऱ्या एजंट्सचे कोडिंग करणे विशेषतः संवेदनशील असते, कारण वॉल-क्लॉक वेटिंग स्टॅकमुळे, काही शेकडो फेऱ्यांनंतर २०० मिलीसेकंदांचा निर्णय आणि ३० मिलीसेकंदांचा निर्णय हे पूर्णपणे वेगळे वाटू लागतात. जेव्हा खरी अडचण इंटरॅक्टिव्ह लॅगची असते, तेव्हा वापरकर्ते अनेकदा 'मॉडेलच मूर्ख आहे' असा दोष देतात.
तरीही - आणि हा प्रौढ देखरेखीचा परिच्छेद आहे - जोपर्यंत कोणीतरी सामायिक हार्डवेअरवर आणि सामायिक प्रॉम्प्ट्ससह त्यांची पुनरावृत्ती करत नाही, तोपर्यंत ऑथर बेंच हे मार्केटिंगच असतात. हलक्या फाइन-ट्यूनिंगचे परिणाम देखील बरीचशी पायाभूत रचना लपवू शकतात. DeepSWE आणि Terminal-Bench चे चांगले आकडे उत्साहवर्धक असतात, कारण ते सूट्स नाजूक एजंट्सना शिक्षा देतात, पण उत्साह म्हणजे पुनरावृत्ती नव्हे. 9× वर आणि त्या 32 ms-क्लास आकृतीवर 'CLAIM' लिहिलेली एक चिकट चिठ्ठी (sticky note) लावून ठेवा.
तुलना तक्ता: टोकन-बाय-टोकन एलएलएम विरुद्ध सीएलएम-शैलीतील फ्रेमिंग
जेव्हा मार्केटिंगची भाषा गुंतागुंतीची होते, तेव्हा तक्ते उपयुक्त ठरतात. या तक्त्यामध्ये, संशोधकांनी वर्णन केलेल्या 'कॉन्ट्रास्टिव्ह लँग्वेज मॉडेल'च्या कथेसोबत, एलएलएम (LLM) पिढीच्या सामान्य सवयींची तुलना केली आहे. यातील रकाने मुद्दाम थोडे असमान ठेवले आहेत, कारण ठोस तुलना नेहमीच तशा असतात.
| कोन | ठराविक एलएलएम (टोकन-दर-टोकन) | सीएलएम-शैली / सिस्टम १ फ्रेमिंग | एजंटांसाठी हे का महत्त्वाचे आहे |
|---|---|---|---|
| प्राथमिक लूप | पुढील टोकनचा अंदाज लावा, अनेकदा दीर्घ ट्रेससह | स्थितीला कृतीशी जोडा; तुलनात्मक निर्णय पक्षपात | टूल कॉल्सच्या दरम्यान कमी टोकन्स वाया जातात (सैद्धांतिकदृष्ट्या) |
| विलंबाची भावना | अनेक टप्प्यांच्या नियंत्रणाखाली असताना बोलके-हळू वाटू शकते | लेखकांचा दावा आहे की जेव्ह-क्लासच्या तुलनेत विलंब खूपच कमी आहे | इंटरॅक्टिव्ह कोडिंग एजंटना प्रतीक्षा वेळेचा तिरस्कार असतो |
| सामर्थ्य क्षेत्र | गद्य, नियोजनात्मक निबंध, विस्तृत चर्चा | जलद स्थिती→कृती - एजेंटिक कोडिंगवर प्रकाश टाकला | वेगळे काम, पण नेहमीच बदली नसते |
| नोंदवलेले आकडे | मॉडेलवर अवलंबून आहे; येथे कोणताही एकच आकडा नाही | सुमारे ९ पट अधिक वेगवान (दावा); डीपएसडब्ल्यूई ~८१.६%; लाईट एफटीनंतर टर्मिनल-बेंच २.१ ~८७.६% (दावा) | तिसऱ्या पक्षांनी पुष्टी केल्यास आशादायक - पण 'जर' ही एक मोठीच गोष्ट आहे |
| मोकळेपणा | बंद एपीआय आणि खुल्या वजनांचे मिश्रण | अपाचे २.० अंतर्गत तयार केलेले खुले वजन/कोड | अटींचा अंदाज न लावता स्वतः जुळवून घ्या आणि आयोजन करा |
| पकड / विचित्रता | हुशार आहे पण कधीकधी कायमच सांगत राहते 🐢 | अजून सुरुवातीचा काळ आहे; स्वतंत्र पुन:प्रसारण प्रलंबित आहे | एकाच प्रेस चार्टवर कंपनीची बाजी लावू नका |
तक्त्याचा वापर एक मानसिक मॉडेल म्हणून करा, अंतिम निर्णय म्हणून नाही. प्रॉडक्ट टीम्सना अजूनही त्यांच्या कार्यक्षमतेचे मोजमाप करणे आवश्यक आहे: टूल स्कीमा, रिट्राई पॉलिसी आणि वातावरणातील गोंधळ हे स्लाईड डेकमध्ये मान्य केलेल्या गोष्टींपेक्षा गुणांवर अधिक परिणाम करतील.
या गोंधळामागे कोण आहे 👤
श्रेय देणे महत्त्वाचे आहे, कारण ओपन एआय ड्रॉप्समध्ये काळजीपूर्वक केलेल्या लॅब रिलीजपासून ते अज्ञात टॉरेंट्सपर्यंत विविध प्रकारांचा समावेश असतो. या प्रकरणात काही व्यक्ती आहेत. जॅकी क्वोक यांनी सीएलएम (CLM) सादर केले; अझालिया मिर्होसेनी यांनी ते अधिक लोकांपर्यंत पोहोचवण्यात मदत केली; आणि यावरील वृत्तांकनात सातत्याने स्टॅनफोर्ड आणि एनव्हिडिया यांच्यातील एका संशोधन सहकार्यालाच समोर आणले जाते. यामुळे प्रत्येक आकडा आपोआप खरा ठरत नाही, पण यामुळे प्रतिष्ठेची बाब नक्कीच जोडली जाते. अनामिक डंप्सच्या तुलनेत, नामांकित संशोधकांच्या ओपन रिलीजची अधिक वेगाने कसून तपासणी केली जाते - कारण पीअर्सना सार्वजनिक लक्ष्य आवडते.
निर्मात्यांसाठी, याचा व्यावहारिक परिणाम म्हणजे उपलब्धता. ओपन वेट्स आणि अपाचे २.० स्टाईल लायसन्स (जसे लाँचच्या वेळी सांगितले होते) यामुळे, केवळ संशोधनासाठी असलेल्या लायसन्सच्या तुलनेत तुम्ही कमी अडचणींसह व्यावसायिक प्रयोग करू शकता. काहीही प्रकाशित करण्यापूर्वी, रिलीजमधील प्रत्यक्ष लायसन्स फाइल्स स्वतः तपासा; व्याप्तीचा सारांश हा करार नसतो. हे कदाचित पांडित्यपूर्ण वाटेल, पण लायसन्सबाबतचे हे पांडित्य स्टार्टअप्सना वाचवते.
सामाजिक प्रसाराची पद्धत ओळखीची आहे: संशोधकाची पोस्ट, प्रतिष्ठित प्रसारकाची कोट-पोस्ट, आणि मग 'एजंट्सनी अखेर समस्या सोडवली' अशा प्रतिक्रियांची लाट. हार्नेसचे तपशील शेअर करणाऱ्या लोकांना फिल्टर करा. एका यशस्वी कोडिंग रनचे स्क्रीनशॉट्स म्हणजे केवळ एक देखावा असतो, विज्ञान नव्हे. 🛰️
स्टेट-टू-ॲक्शन लूप्स एजेंटिक कोडिंग का वापरतात?
एजेंटिक कोडिंग हे एक कठोर वातावरण आहे. मॉडेलला एक रेपो स्नॅपशॉट, एक शेल ट्रान्सक्रिप्ट, कदाचित एक अयशस्वी चाचणी दिसते आणि त्याला एक एडिट किंवा एक कमांड निवडावी लागते. चॅटपेक्षाही यश बहुतेकदा द्विआधारी असते. एकतर चाचणी यशस्वी होते किंवा नाही. हे रिवॉर्ड शेप, अपयशावर सुंदर निबंध लिहिणाऱ्या मॉडेल्सपेक्षा, कृती स्पष्टपणे निवडणाऱ्या पॉलिसींना अधिक पसंती देते.
कॉन्ट्रास्टिव्ह ट्रेनिंग स्टोरीज त्या जगात चपखल बसतात, कारण त्या दिलेल्या स्थितीमध्ये नेटवर्कला प्राधान्य दिलेल्या कृतींकडे स्पष्टपणे ढकलतात. याचा विचार असा करा की, एखाद्या ज्युनियर इंजिनिअरला "कंपाइलर्स अवघड का असतात यावर एक ब्लॉग पोस्ट लिहा" असे शिकवण्याऐवजी, "जेव्हा तुम्हाला ही एरर क्लास दिसेल, तेव्हा हा फिक्स पॅटर्न वापरा" असे शिकवणे. त्या ज्युनियरला अजूनही निर्णयक्षमता लागतेच; हा शॉर्टकट फक्त त्याचा गोंधळ कमी करतो.
येथे विलंब वाढत जातो. समजा, एका एजंटला एक मध्यम बगफिक्स कार्यान्वित करण्यासाठी सरासरी ऐंशी टूल स्टेप्स लागतात. प्रत्येक स्टेपमागे १५० मिलिसेकंद कमी केल्यास, तुम्हाला प्रत्यक्ष वेळेतील बारा सेकंद परत मिळतात - आणि हाच फरक आहे एका प्रवाही अवस्थेत असणे आणि वापरकर्त्याने ईमेल तपासण्यासाठी ऑल्ट-टॅब करणे यात. अनेक एजंट्स चालवणाऱ्या टीम्सना क्लाउडमधील या गणिताचा खर्चही जाणवतो. जेव्ह-क्लास समकक्ष एजंटच्या तुलनेत इन्फरन्स स्पीडमध्ये दहा पटीने वाढ झाल्याचा दावा, जरी प्रत्यक्षात ती "फक्त" ४ पट असली तरी, क्षमता नियोजनात बदल घडवून आणते.
मी मीटिंगमध्ये एक डळमळीत रूपक वापरत असतो: टोकन-बाय-टोकन चॅट मॉडेल्स म्हणजे प्रत्येक चौकात मार्गावर चर्चा करण्यासारखे आहे, तर सिस्टम १ स्टाईल कंट्रोलर हे शहरात गाडी चालवण्यासाठी लागणाऱ्या स्नायूंच्या स्मृतीसारखे आहे. नवीन शहरात स्नायूंची स्मृती अपयशी ठरते. जेव्हा रेपो कल्चर वैशिष्ट्यपूर्ण असते, तेव्हा मर्यादित स्वरूपाचे ॲक्शन मॉडेलही तसेच काम करते. नवीन आर्किटेक्चरच्या निवडींसाठी तुम्हाला अजूनही विचारपूर्वक पद्धती हव्या असतात; पन्नासाव्यांदा "इम्पोर्ट दुरुस्त करा आणि पुन्हा चालवा" यासारख्या गोष्टींसाठी तुम्हाला सहज प्रतिसाद हवा असतो. हायब्रिड स्टॅक्स - वेगवान सीएलएम-सारखा कंट्रोलर आणि हार्ड ब्रांचेसवर अधिक शक्तिशाली रिझनर - हेच कदाचित गंभीर सिस्टीम्सचे अंतिम स्वरूप आहे, जरी लॉन्च पोस्ट्समध्ये एकाच हिरो मॉडेलची जाहिरात केली जात असली तरी. 🚦
हे देखील स्पष्टपणे सांगण्यासारखे आहे की: DeepSWE आणि Terminal-Bench स्कॅफोल्डिंगला पुरस्कृत करतात. हार्नेसची गुणवत्ता, टूल अलाऊलिस्ट्स आणि रिकव्हरी प्रॉम्प्ट्स यशाच्या दरात दुहेरी अंकांनी बदल घडवू शकतात. जेव्हा तुम्हाला थोडेफार फाइन-ट्यूनिंग केल्यानंतर ~८१.६% किंवा ~८७.६% निकाल दिसतो, तेव्हा त्या वेट्सभोवती कोणता रॅपर होता याचा सखोल तपास करा. ही टीका नाही; हे या क्षेत्राचे कार्यच आहे.
ओपन वेट्स, फाइन-ट्यूनिंग आणि ३५बी शॅडो
ओपन वेट्स एखाद्या दाव्याची सामाजिक गतिशीलता बदलतात. क्लोज्ड API मॉडेल्स एक चार्ट दाखवून तुम्हाला दूषितता, डीकोडिंगच्या युक्त्या किंवा गुप्त सिस्टीम प्रॉम्प्ट्सबद्दल अंदाज बांधायला लावू शकतात. डाउनलोड करण्यायोग्य पॅरामीटर्समुळे तुम्ही किमान त्या गोष्टीला स्पर्श तरी करू शकता. तुमच्या अंतर्गत कोडिंग वातावरणासाठी - तुमचे लिंट नियम, तुमचा डिप्लॉय CLI, तुमची मोनोरिपो टोपोलॉजी - CLM-8B ला फाइन-ट्यूनिंग करणे, हाच चमकदार बेंच आकडेवारी मिळवण्याचा वास्तववादी मार्ग आहे, पहिल्याच दिवशी शून्य-शॉट जादू करणे नव्हे.
(वृत्तानुसार) अपाचे २.० ची रचना निर्मात्यांसाठी अनुकूल आहे: पेटंट मंजुरीची भाषा, पुनर्वितरणाचे स्पष्ट नियम, आणि 'केवळ संशोधनासाठी' असलेले सापळे कमी आहेत. पुन्हा एकदा: फाईल्स वाचा. वृत्तलेखक सारांश देतात; वकील विशेषज्ञता मिळवतात.
नियोजित CLM-35B हा रोडमॅप स्लाईडमधील एक मोठा अडथळा आहे. जोपर्यंत डिस्टिलेशन किंवा काल्पनिक युक्त्या लेटन्सी नियंत्रणात ठेवत नाहीत, तोपर्यंत मोठी मॉडेल्स अनेकदा विचारपूर्वक कौशल्य पुन्हा मिळवतात आणि 'लहान पण प्रचंड वेगवान' हे आकर्षण काही प्रमाणात गमावतात. जर आठ अब्ज डॉलर्सचे मॉडेल स्पोर्ट्स कार असेल आणि पस्तीस अब्ज डॉलर्सचे मॉडेल टूरिंग सेडान असेल, तर संघ कदाचित दोन्ही ठेवतील: 8B हॉट लूप्ससाठी, आणि 35B सखोल नियोजनासाठी. किंवा हार्डवेअर स्वस्त होत राहिल्यास मोठे मॉडेलच वर्चस्व गाजवू शकते. कोणते भविष्य येईल हे अजूनही अनिश्चित आहे; भविष्यातील रिलीज नोट्स ते ठरवतील, हा परिच्छेद नाही.
ओपन एजंट मॉडेल्समधील एक सूक्ष्म धोका म्हणजे: लोक रेट लिमिट्सशिवाय त्यांना CI मध्ये समाविष्ट करतील आणि दुर्भावनापूर्ण READMEs द्वारे प्रॉम्प्ट इंजेक्शन शोधून काढतील. वेगवान मॉडेल्स ज्याप्रमाणे व्यावहारिक मूल्य वाढवतात, त्याचप्रमाणे ते गैरवापरही वाढवतात. गार्डरेल्स हे ऐच्छिक दिखावा नाहीत; ते एक उत्पादनच आहेत.
- गुणवत्तेचा न्याय करण्यापूर्वी तुमच्या स्वतःच्या ट्रेसमध्ये सुधारणा करा
- नवीन कामांसाठी एक पळवाट म्हणून हळू विचार करणाऱ्या व्यक्तीला सोबत ठेवा
- तुमच्या हार्नेसमध्ये इन्स्ट्रुमेंट लेटन्सी p50/p95, केवळ अचूकता नव्हे
- असे गृहीत धरा की 35B पॅरेटो फ्रंटियरला पुन्हा सरकवेल
बर्फात न अडकता जेवची तुलना वाचणे
जेव्ह-क्लास मॉडेल्सशी केलेली तुलना केवळ शाब्दिक काम साधते. ती एजेंटिक स्पीडच्या स्तरावर एक समकक्ष मॉडेल स्थापित करते, जेणेकरून "९ पटींपर्यंत अधिक वेगवान" या विधानाला एक संदर्भ मिळतो. सापेक्ष दाव्यांना एका आधाराची गरज असते, आणि ही गोष्ट योग्य आहे. धोका हा आहे की संपूर्ण इव्हॅल्युएशन स्टॅकला एकाच गुणकामध्ये संकुचित केले जाते. बॅच साइज, प्रिसिजन, डीकोडिंग सेटिंग्स, कॉन्टेक्स्टची लांबी आणि टूल-कॉल सिरियलायझेशन हे सर्व घटक "अधिक वेगवान" या शब्दाच्या अर्थाला नव्याने आकार देतात, आणि हे सर्व घटक क्वचितच एकाच स्लाइडमध्ये दिसतात.
जेव्हा क्लस्टर सारांशामध्ये टर्मिनल बेंच सेटिंगवर ~32 मिलिसेकंदांच्या प्रतिसादांचा उल्लेख असतो, तेव्हा जोपर्यंत कोणीतरी हे स्पष्ट करत नाही की त्याचा अर्थ पहिला टोकन, संपूर्ण ॲक्शन JSON, किंवा कॅश्ड प्रीफिक्स आहे, तोपर्यंत "प्रतिसाद" (response) याला एक संदिग्ध लेबल समजा. हे भेद मार्केटिंगमधील मिलिसेकंदांचे इंजिनिअरिंगमधील तासांमध्ये रूपांतर करतात. कमी लेटन्सीसह तुलनात्मक झिरो-शॉट गुणवत्ता हे एक स्वप्नवत संयोजन आहे; जर स्वतंत्र गटांनी या स्वप्नाच्या अर्ध्या भागाची जरी पुष्टी केली, तर CLM-शैलीतील प्रशिक्षणाला आर्किटेक्चर बैठकांमध्ये कायमचे स्थान मिळेल.
तोपर्यंत, जेव्हला एका स्थिर लीडरबोर्डपेक्षा स्पर्धेचे कथानक म्हणून अधिक माना. स्पर्धांमुळे पोस्ट्स विकल्या जातात. तुमच्या प्रोडक्शन केपीआयंना कथानकाची पर्वा नसते. टास्कमधील यश, सोडवलेल्या प्रत्येक तिकीटमागे मिळणारे डॉलर आणि मानवी हस्तक्षेपाचा दर मोजा. जर कॉन्ट्रास्टिव्ह लँग्वेज मॉडेलच्या फोर्कने हे सर्व जिंकले, तर आनंद साजरा करा. जर त्याने फक्त ट्विटर जिंकले, तर पुढे चालत राहा. 🚶
थोडा विरोधाभास: स्पर्धेच्या कथांना अजूनही महत्त्व आहे. त्या प्रयोगशाळांना पोकळ भावनांऐवजी आकडेवारी प्रकाशित करण्यास भाग पाडतात. फक्त धावफलकाला खेळाशी जोडू नका.
या रिलीझमध्ये काय सुधारण्याची गरज आहे
CLM-8B ला केवळ बातम्यांपुरते मर्यादित न राहता त्याचे महत्त्व टिकून राहण्यासाठी, काही गोष्टी जुळून येणे आवश्यक आहे:
- प्रतिकृतीकरण: बाहेरील गटांनी दस्तऐवजीकृत कृतींच्या साहाय्याने मुख्य विलंब दर आणि कोडिंग यश दरांशी जुळवून पाहता आले पाहिजे.
- पारदर्शकतेचा वापर करा: DeepSWE आणि Terminal-Bench स्कोअर देणारे एजंट रॅपर तपशील सामायिक करा.
- प्रयोगशाळेतील माहिती आपोआप कळेल असे गृहीत न धरणारे दस्तऐवज: क्लिअर फाइन-ट्यून स्क्रिप्ट्स, इव्हॅल कमांड्स आणि हार्डवेअर नोट्स.
- अपयशाचे प्रकार: सिस्टम १ पद्धतीचे निर्णय कोठे अयशस्वी होतात ते दाखवा - नवीन API, संदिग्ध तिकिटे, सुरक्षेच्या दृष्टीने संवेदनशील ऑपरेशन्स.
- अपग्रेड मार्ग: CLM-35B चा संबंध कसा आहे हे स्पष्ट करा, जेणेकरून टीम्स त्यांच्या स्टॅकला 8B डेड एंडपर्यंत ओव्हरफिट करणार नाहीत.
जर ते रकाने रिकामे राहिले, तर ते मॉडेल एक आणखी मनोरंजक पेपरवेट बनते. जर ते भरले गेले, तर एजंट प्लॅटफॉर्मना घटकांची एक ठोस निवड मिळते: सखोल विचारांसाठी विचारपूर्वक एलएलएम (deliberative LLM), आणि थरथरणाऱ्या हातांसाठी तुलनात्मक जलद मॉडेल (contrastive fast model). एकाच मेगामॉडेलने प्रत्येक लेटन्सी बजेटमध्ये प्रत्येक काम करावे असा आव आणण्यापेक्षा, कामाची ही विभागणी अधिक प्रौढ वाटते.
माल पाठवणाऱ्या बांधकाम व्यावसायिकांसाठी उपयुक्त मुद्दे
तुम्हाला उद्याच तुमचा स्टॅक पुन्हा लिहिण्याची गरज नाही. पण जलद निर्णय घेणाऱ्या मॉडेल्सचे मूल्यांकन करण्यासाठी तुमच्याकडे एक योजना असणे आवश्यक आहे. तुमच्या एजंटमधील लेटन्सीसाठी महत्त्वाचा असलेला भाग - उदाहरणार्थ टर्मिनल मायक्रो-लूप किंवा 'पुढील ग्रेप निवडा' ही पायरी - वेगळा काढून सुरुवात करा आणि तुमच्या सध्याच्या मुख्य मॉडेलच्या तुलनेत CLM-8B फाइन-ट्यूनिंगची A/B चाचणी करा. हार्नेस स्थिर ठेवा. प्रत्येक गोष्टीची नोंद ठेवा.
गुणवत्तेतील छुपे दोष टाळा: महत्त्वाच्या रिपॉझिटरीजमध्ये, आत्मविश्वासाने चुकीच्या कृती करून त्वरित प्रतिसाद देणारे मॉडेल्स, हळू चालणाऱ्या योग्य मॉडेल्सपेक्षा वाईट असतात. पडताळणीच्या पायऱ्या वाढवा. उलटवता येण्याजोग्या साधनांना प्राधान्य द्या. आत्मविश्वास कमी असताना दुसऱ्यांदा मॉडेल कॉल करण्यासाठी तरतूद करा - हो, यामुळे वेगातील काही फायदा कमी होतो, आणि ते ठीक आहे. नियंत्रणाशिवायचा वेगच डेमोला आउटेजमध्ये बदलतो.
संस्थेच्या बाजूने, क्षमता पत्रकांमध्ये (capacity sheets) केवळ 'टोकन्स प्रति सेकंद' ऐवजी 'प्रति GPU प्रति सेकंद क्रिया' (actions per second per GPU) साठी एक स्तंभ (column) जोडून ती अद्ययावत करा. एजेंटिक वर्कलोड्सना (Agentic workloads) निर्णयांची काळजी असते, काव्यमय थ्रुपुटची (poetry throughput) नाही. जर लेखकांचा ~९ पट वाढीचा दावा तुमच्या हार्डवेअरच्या संपर्कात अंशतः जरी टिकला, तर तुमची स्प्रेडशीट वेगळी दिसेल. जर तसे झाले नाही, तर तुम्ही कमी पैशात धडा शिकलात.
आणि कृपया, ऑपरेशन्सच्या भल्यासाठी, केवळ मॉडेल "सुरक्षित" वाटले म्हणून प्रायोगिक एजंटमध्ये प्रोडक्शनची गुपिते टाकू नका. जलद ओपन मॉडेल्समुळे अशा छुप्या सिस्टीम्स सुरू करणे सोपे होते, ज्यांचे कोणीही पुनरावलोकन करत नाही. प्रक्रिया अजूनही महत्त्वाची आहे.
प्रलंबित धागे अजूनही अधांतरी आहेत
काही न सुटलेल्या समस्यांमुळे मी पूर्णपणे प्रचाराच्या मूडमध्ये येऊ शकत नाही:
- नोंदवलेल्या कोडिंग यशापैकी किती श्रेय वेट्सला जाते आणि किती फाइन-ट्यून डेटा व रॅपरला, हे अद्याप स्पष्ट झालेले नाही.
- जेव्हा कार्यांना स्थानिक शेल प्रतिसादांऐवजी दूरगामी नियोजनाची आवश्यकता असते, तेव्हा सिस्टम १ फ्रेमिंग विरळ होऊ शकते.
- CLM-35B लेटन्सीची चांगली कामगिरी कायम ठेवू शकते किंवा आणखी एक मजबूत मध्यम आकाराचे LLM म्हणून स्थिरावू शकते.
- वितरणातील बदलांमुळे - नवीन भाषा, नवीन क्लाउड सीएलआय, प्रतिकूल रेपो - परस्परविरोधी कृती प्राधान्ये कमकुवत होऊ शकतात.
- जेव्हा कृती मिलिसेकंदांमध्ये पार पडतात, तेव्हा सुरक्षिततेच्या संकल्पनेला अधिक तपशिलाची गरज असते.
त्या टीमची बदनामी करण्याच्या उद्देशाने घातलेल्या अडचणी नाहीत. कोणत्याही गंभीर स्वीकृती समीक्षेने करायलाच हव्यात अशा त्या तपासण्या आहेत. सुरुवातीच्या काळात खुल्या असलेल्या रिलीझची काळजीपूर्वक छाननी आणि तपासणी व्हायला हवी, डोळे झाकून इन्स्टॉल करायला नको.
सारांश
CLM-8B हे एजंट्ससाठी जलद स्टेट-टू-ॲक्शन वर्तनाच्या उद्देशाने तयार केलेले एक ओपन, अपाचे-फ्रेम्ड (कव्हरेजनुसार) कॉन्ट्रास्टिव्ह लँग्वेज मॉडेल आहे. हे जॅकी क्वोक यांनी अझालिया मिर्होसेनी यांच्या पाठिंब्याने सार्वजनिकरित्या सादर केले असून, स्टॅनफोर्ड/एनव्हिडिया-संबंधित संशोधन म्हणून मांडले आहे. याचे मुख्य दावे - जेव्ह-क्लास इन्फरन्सपेक्षा सुमारे ९ पट अधिक वेगवान, किरकोळ फाइन-ट्यूनिंगनंतर उत्तम डीपएसडब्ल्यूई (DeepSWE) आणि टर्मिनल-बेंच (Terminal-Bench) निकाल, खूप कमी लेटन्सीसह तुलनीय झिरो-शॉट गुणवत्ता, ज्यात सुमारे ३२ मिलिसेकंदांच्या टर्मिनल प्रतिसादांबद्दलच्या चर्चेचा समावेश आहे - हे लेखकांनी स्वतः नोंदवलेले असून, त्यांना अद्याप व्यापक तृतीय-पक्षाच्या पुष्टीकरणाची प्रतीक्षा आहे. एक मोठे CLM-35B मॉडेल लवकरच येणार आहे.
जर तुम्ही एजेंटिक कोडिंग सिस्टीम तयार करत असाल, तर हे एका केंद्रित मूल्यांकनास पात्र आहे, धर्मासमान नाही. याला हायब्रीड स्टॅकमधील संभाव्य सिस्टीम १ कंट्रोलर म्हणून माना, तुमच्या स्वतःच्या कार्यक्षमतेचे मोजमाप करा आणि जोपर्यंत स्वतंत्र चाचण्या यशस्वी होत नाहीत, तोपर्यंत प्रत्येक चार्टवर 'दावा' (CLAIM) स्टिकर लावून ठेवा. नवीन लोगो असलेले आणखी एक चॅट मॉडेल ही मनोरंजक गोष्ट नाही. मनोरंजक गोष्ट ही आहे की, निर्णय-आधारित प्रशिक्षणामुळे एजंटांना अविचारीपणे चुकीचे न बनवता, त्यांना तत्परतेची जाणीव होऊ शकते का.
व्यावहारिक उदाहरण: CLM-8B साठी लेटन्सी-क्रिटिकल एजंट मायक्रो-लूप इव्हॅल तयार करणे
बद्दलचे लेखकाचे चार्ट्स एजंट्ससाठी Jev पेक्षा ९ पट अधिक वेगवान असल्याचा दावा करणाऱ्या नवीन ओपन एआय मॉडेलबद्दल आहेत. येथे यूकेमधील एका स्वतंत्र टूलिंग टीमने CLM-8B ला चॅटचा पर्याय म्हणून नव्हे, तर संभाव्य सिस्टम १ कंट्रोलर म्हणून कसे हाताळले आणि त्यांच्या स्वतःच्या टर्मिनल मायक्रो-लूपवर त्याचे मोजमाप कसे केले, हे सांगितले आहे.
परिस्थिती
सॅम एक छोटे उत्पादन चालवतो, जे मल्टी-फाइल रिफॅक्टरसाठी आधीपासूनच एक अधिक शक्तिशाली कोडिंग एजंट वापरते. यातली त्रासदायक बाब म्हणजे हॉट लूप: अयशस्वी चाचणीचे प्रतिलेखन वाचणे, पुढील शेल किंवा संपादन क्रिया निवडणे, ती चालवणे, आणि हीच प्रक्रिया पुन्हा करणे. वापरकर्ते कंटाळवाण्या उत्तरांपेक्षा पन्नास टूल स्टेप्समधील अतिशय मंद गतीच्या लॅगबद्दल जास्त तक्रार करतात. सोशल मीडियावरील पोस्ट्स कॉन्ट्रास्टिव्ह लँग्वेज मॉडेलच्या वेट्सबद्दल आणि जेव्ह-क्लास प्रतिस्पर्धकांच्या तुलनेत सुमारे ९ पट वेगवाढीच्या दाव्याबद्दल, तसेच किरकोळ फाइन-ट्यूनिंगनंतर मिळालेल्या उत्तम डीपएसडब्ल्यूई / टर्मिनल-बेंचच्या आकडेवारीबद्दल अधिक माहिती देत आहेत. सॅम केवळ प्रसिद्धीसाठी उत्पादन कोड पुन्हा लिहिण्यास नकार देतो.
ते एक लेटन्सी-क्रिटिकल मायक्रो-लूप तयार करतात: त्यांच्या स्वतःच्या मोनोरिपोमधील वीस दुरुस्त केलेले बगफिक्स ट्रेसेस. नवीन आर्किटेक्चर तिकीटांसाठी सध्याचा मुख्य मार्ग हाच विचारविनिमयाचा मार्ग राहतो. CLM-8B - जर होस्ट केले असेल आणि त्यांच्या ट्रेसेसवर हलकेसे फाइन-ट्यूनिंग केले असेल तर - त्याला फक्त "पुढील रिव्हर्सिबल ॲक्शन निवडा" या टप्प्यावरच स्पर्धा करण्याची परवानगी आहे, आणि जेव्हा आत्मविश्वास कमी असतो तेव्हा सुटकेचा मार्ग म्हणून एक धीमा रीझनर वापरला जातो.
उद्दिष्ट एक अशी A/B चाचणी आहे, ज्यात सर्व घटक स्थिर ठेवले जातात: समान साधने, समान परवानगी सूची आणि समान पुनःप्रयत्न धोरण. प्रति सेकंद होणाऱ्या क्रिया, p50/p95 विलंब, कार्याची यशस्वीता आणि मानवी हस्तक्षेप यांची नोंद ठेवा - आणि मग ठरवा की खुल्या भारांना स्थान मिळायला हवे की नाही.
सहाय्यकाला काय हवे आहे
- प्रत्यक्ष कामातील वीस अनामिक अयशस्वी-चाचणी ट्रेस (केवळ इनपुट + अनुमत साधने)
- एक निश्चित एजंट रॅपर: टूल स्कीमा, अलाउलिस्ट, कमाल स्टेप्स, आणि “स्लो रीझनरला कॉल करा” ब्रांच
- त्याच वीस कार्यांसाठी सध्याच्या मॉडेलवरील बेसलाइन स्कोअर
- CLM-8B होस्टसाठी हार्डवेअर नोट्स (GPU क्लास, प्रिसिजन, बॅच) जेणेकरून “अधिक वेगवान” याला एक संदर्भ मिळेल
- क्लेम स्टिकरचा नियम: जोपर्यंत हे हार्नेस काहीतरी पुनरुत्पादित करत नाही, तोपर्यंत लेखक DeepSWE / Terminal-Bench / ~9× / ~32 ms हे आकडे लेबल केलेले राहतील
- कोणताही सीआय बोल्ट-ऑन करण्यापूर्वी, चुकीच्या पण जलद कृतींचे पुनरावलोकन करणारा एक मानवी मालक
उदाहरण सूचना
तुम्ही आमच्या कोडिंग एजंटमध्ये वेगवान स्टेट→ॲक्शन कंट्रोलर म्हणून CLM-8B साठी एक योग्य A/B चाचणी डिझाइन करण्यास मला मदत करत आहात. मी दिलेली हार्नेसची माहितीच वापरा. लेटन्सी मल्टिप्लायर्स, डीपएसडब्ल्यूई स्कोअर्स किंवा परवान्याच्या अटी स्वतः तयार करू नका.
कार्य: माझ्या वीस कार्यांच्या नावांवरून आणि सध्याच्या बेसलाइन नोट्सवरून, (1) 'कार्य / मॉडेल / पायऱ्या / वॉल-क्लॉक / यश (उत्तीर्ण/अनुत्तीर्ण) / मानवी हस्तक्षेप (होय/नाही) / नोट्स' या स्तंभांसह एक स्कोअरिंग शीट, (2) सर्व मॉडेल्समध्ये रॅपर एकसारखा ठेवणारा एक सहा-मुद्द्यांचा प्रोटोकॉल, आणि (3) CLM-8B मायक्रो-लूपचा ताबा कधी घेऊ शकतो आणि कधी आपण हे प्रकरण स्लो रीझनरकडे सोपवावे, यासाठी स्पष्ट आणि दैनंदिन भाषेत एक निर्णय नियम तयार करा.
मर्यादा: यूके इंग्रजी. लेखकाने नोंदवलेल्या प्रत्येक संख्येला, ती आढळल्यास, 'दावा' (CLAIM) असे लेबल लावा. उलटवता येण्याजोग्या साधनांना प्राधान्य द्या. “एजंट्सचे कोडे अखेर सुटले” अशा भाषेवर बंदी घाला. माझ्या पेस्टमध्ये एखादे मेट्रिक नसल्यास, अंदाज लावण्याऐवजी [मापनाची आवश्यकता आहे] असे लिहा.
आउटपुट: स्कोअरिंग-शीटचे शीर्षक आणि प्लेसहोल्डर्स वापरून भरलेली एक उदाहरण ओळ, प्रोटोकॉल बुलेट्स, आणि त्यानंतर एस्केलेट/कीप नियम. कोणतीही प्रस्तावना नाही.
त्याची चाचणी कशी करावी
- सध्याच्या वर्कहॉर्सवर आणि त्याच रॅपरसह CLM-8B फाइन-ट्यूनिंग मशीनवर तेच दहा ट्रेसेस चालवा. केवळ वॉल-क्लॉक आणि सक्सेस टाइममध्ये फरक असल्याची खात्री करा - टूल लिस्टमध्ये नाही.
- प्रश्न: “या आठवड्यात कोणता ऑथर चार्ट उत्पादनात बदल घडवू शकतो?” एक चांगले उत्तर: जोपर्यंत हे हार्नेस सक्सेस आणि लेटन्सी या दोन्हीमध्ये एकत्रित विजय दाखवत नाही, तोपर्यंत एकही नाही.
- अपवादात्मक परिस्थिती: CLM-8B सुमारे ३० मिलिसेकंदात एक विनाशकारी कमांड सुचवते - CI करण्यापूर्वी अलाउलिस्ट आणि मानवी पुनरावलोकनाने ते पकडले आहे याची खात्री करा.
- अपवादात्मक प्रकरण: वीस ट्रेसच्या बाहेरील नवीन API तिकीट - याची पुष्टी करा की ते रिफ्लेक्स मॉडेलचे नसून स्लो रीजनरचे आहे.
- स्वीकृती तपासण्या: (1) मोजलेला परिणाम म्हणून कोणताही काल्पनिक 9× दावा नाही, (2) p50 आणि p95 लेटन्सी लॉग केली जाते, (3) यशाचा छेद वीस टास्क आहेत, (4) चुकीच्या-जलद कृती मोजल्या जातात, (5) कोणत्याही व्यावसायिक शिपिंग योजनेपूर्वी अपाचे/लायसन्स तपासणी ऑफलाइन होते.
निकाल
उदाहरणात्मक निकाल (वीस निश्चित मोनोरिपो ट्रेसेसवरील तीन-व्यक्तींच्या टूलिंग टीमसाठीचा अंदाजित नमुना, लेखकांच्या बेंचची स्वतंत्र लॅबमध्ये केलेली पुनरावृत्ती नाही): बेसलाइन वर्कहॉर्सने मानवी मदतीशिवाय २० पैकी १४ ट्रेसेस पूर्ण केले; सरासरी स्टेप लेटन्सी सुमारे १८० एमएस होती; एका चुकीच्या एडिटनंतर दोन ट्रेसेससाठी मानवी मदतीची गरज लागली. अंतर्गत ट्रेसेसवर (तोच रॅपर) CLM-8B चे हलके फाइन-ट्यूनिंग केल्यानंतर, २० पैकी १५ ट्रेसेस मदतीशिवाय पास झाले; त्यांच्या सिंगल-जीपीयू होस्टवर सरासरी स्टेप लेटन्सी सुमारे ४५ एमएस होती; अप्लाय करण्यापूर्वी अलाउलिस्टने एक अतिरिक्त चुकीची-जलद क्रिया पकडली. व्हेरिफिकेशन स्टेप्ससह वीस-ट्रेस सूटसाठी लागलेला एकूण वेळ (वॉल-क्लॉक) सुमारे ३८ मिनिटांवरून सुमारे २२ मिनिटांपर्यंत कमी झाला. हायजीन चेकलिस्टवर (हार्नेस स्थिर ठेवला, ऑथर चार्टवर क्लेम लेबल्स ठेवले, नॉव्हेल तिकीट्ससाठी स्लो रीझनरचा वापर सुरूच ठेवला, प्रायोगिक एजंटमध्ये कोणतेही प्रोडक्शन सिक्रेट्स नाहीत), ५ पैकी ५ रिव्ह्यू आयटम्स पास झाले. मर्यादा: लहान टास्क सेट, एकच हार्डवेअर क्लास, फाइन-ट्यूनिंग डेटा क्वालिटीला प्राधान्य; यामुळे या प्रणालीबाहेर लेखकांचे ~9× किंवा DeepSWE आकडे प्रमाणित होत नाहीत.
तुमच्या स्वतःच्या आवृत्तीचे मोजमाप करण्यासाठी: वीस ट्रेसेस फ्रीझ करा; प्रथम सध्याच्या मॉडेलला स्कोअर करा; डॉक्युमेंटेड प्रिसिजन/सेटिंग्ससह CLM-8B होस्ट करा; त्याच रॅपरसह पुन्हा चालवा; सक्सेस/एन, पी५०/पी९५, इंटरव्हेन्शन्स आणि कोणताही क्लेम नंबर तथ्य म्हणून मानला गेला की नाही याचा अहवाल द्या.
काय बिघडू शकतं?
- चार्ट पूजा: स्वतःच्या p95 शिवाय ~9× स्लाइडवर शिपिंग करणे.
- चुकीच्या-जलद कृती: मोठ्या जोखमीच्या व्यवहारांमध्ये, सावकाशपणे केलेल्या योग्य कृतींवर मात करणाऱ्या तात्काळ, आत्मविश्वासाने केलेल्या चुका.
- हार्नेस ड्रिफ्ट: मॉडेल्स दरम्यान टूल प्रॉम्प्ट्स बदलणे आणि त्याला मॉडेल विन म्हणणे.
- सिंगल-हीरो स्टॅक: नाविन्यपूर्ण आर्किटेक्चर कार्यासाठी विचारविनिमय करणाऱ्या घटकाचा वापर टाळणे.
- परवान्याबाबत दिशाभूल: प्रत्यक्ष वेट-रेपो परवाना फाईल्सऐवजी कव्हरेज सारांशांवर विश्वास ठेवणे.
- शॅडो सीआय: दर मर्यादा किंवा इंजेक्शन पुनरावलोकनाशिवाय पाइपलाइनमध्ये एक वेगवान ओपन एजंट जोडणे.
व्यावहारिक निष्कर्ष
एजेंटिक कोडिंगसाठी संभाव्य सिस्टम १ कंट्रोलर म्हणून CLM-8B चे सखोल मूल्यांकन करणे योग्य आहे - कारण त्यात ओपन वेट्स, निर्णयानुसार आकारलेली कथा आणि लेखकाने सांगितलेले वेगाचे दावे आहेत. जोपर्यंत तुमची हार्नेस तसे सांगत नाही, तोपर्यंत हा कोणताही सिद्धांत नाही आणि तुमच्या स्टॅकसाठी हा एक सिद्ध ९× कंट्रोलर नाही. रॅपर स्थिर ठेवा, प्रति सेकंद क्रिया आणि चुकीच्या-वेगाचा दर लॉग करा, एक हळूवार एस्केप हॅच ठेवा आणि जोपर्यंत स्वतंत्र रन्स (तुमच्या रन्ससहित) यशस्वी होत नाहीत, तोपर्यंत प्रत्येक प्रेस चार्टवर 'क्लेम' स्टिकर तसाच राहू द्या.
वारंवार विचारले जाणारे प्रश्न
CLM-8B म्हणजे काय, आणि एजंट बिल्डर्स त्याबद्दल का बोलत आहेत?
CLM-8B हा कॉन्ट्रास्टिव्ह लँग्वेज मॉडेल मालिकेतील पहिला सार्वजनिक वेट सेट आहे - हे एक ओपन रिसर्च रिलीज आहे, जे केवळ एक सामान्य चॅट ब्रेन नसून, एजंट्ससाठी एक जलद निर्णय प्रक्रिया म्हणून सादर केले आहे. याची ट्रेनिंग स्टोरी, एखाद्या संथ नेक्स्ट-टोकन निबंधाप्रमाणे न राहता, सिस्टीम १ च्या प्रतिक्षिप्त क्रियेप्रमाणे स्टेट्सना अॅक्शन्सशी जोडते. आठ अब्ज पॅरामीटर्स असल्यामुळे, अनेक लॅब्स आणि इंडी बिल्डर्सना ते होस्ट करणे पुरेसे सोपे आहे, आणि याच्या लॉन्चच्या वेळी अपाचे २.० लायसन्सिंग उपलब्ध असेल. लॉन्च पोस्टमधील आकडे हे लेखकांनी दिलेले दावे आहेत, स्वतंत्र लॅबने पुन्हा तपासलेले नाहीत.
CLM-8B एजंट्ससाठी Jev पेक्षा ९ पट अधिक वेगवान असल्याचा दावा कसा केला जातो?
प्रवर्तकांचा दावा आहे की, जेव्ह-क्लास मॉडेल्सच्या तुलनेत इन्फरन्स सुमारे ९ पट अधिक वेगवान आहे आणि टर्मिनल बेंच सेटिंगवर अंदाजे ३२ मिलिसेकंदांच्या प्रतिसादांची चर्चा आहे. किरकोळ फाइन-ट्यूनिंगनंतर, त्यांनी उत्तम एजेंटिक कोडिंग परिणामांचीही नोंद केली आहे - डीपएसडब्ल्यूई (DeepSWE) सुमारे ८१.६% आणि टर्मिनल-बेंच २.१ (Terminal-Bench 2.1) सुमारे ८७.६% - तसेच खूप कमी लेटन्सीमध्ये जेव्हच्या तुलनेत काही झिरो-शॉट गुणवत्ताही मिळाली आहे. जोपर्यंत तृतीय पक्ष सामायिक हार्डवेअरवर हे आकडे पुन्हा सिद्ध करत नाहीत, तोपर्यंत ९ पट आणि मिलिसेकंदांचे आकडे केवळ दावेच माना. सापेक्ष वेगासाठी बॅच साइज, प्रिसिजन आणि डीकोडिंग सेटिंग्ज अद्याप स्पष्टपणे नमूद करणे आवश्यक आहे.
कॉन्ट्रास्टिव्ह लँग्वेज मॉडेलचे प्रशिक्षण सामान्य एलएलएमपेक्षा कसे वेगळे आहे?
बहुतेक प्रोडक्शन एलएलएम (LLMs) एका वेळी एकच टोकन तयार करतात, जे गद्य आणि दीर्घ तर्कासाठी उपयुक्त ठरते, परंतु एजंटने घेतलेल्या प्रत्येक सूक्ष्म-निर्णयावर ताण आणते. प्रवर्तकांच्या वर्णनानुसार, कॉन्ट्रास्टिव्ह लँग्वेज मॉडेल प्रशिक्षण हे नेटवर्कला परिस्थितींना पसंतीच्या कृतींशी जोडण्यासाठी प्रवृत्त करते - हे एखाद्या कादंबरीकारापेक्षा धोरण प्रमुखाप्रमाणे अधिक आहे. ती सिस्टीम १ (System 1) रचना, टूल कॉल्सच्या दरम्यान सतत कथन करण्याऐवजी, जलद स्टेट-टू-ॲक्शन लूप्सना प्राधान्य देते. सीएलएम-८बी (CLM-8B) अजूनही मजकूर प्रसारित करू शकते; त्याचे उद्दिष्ट आणि मूल्यमापनाची कथा एजंटच्या नियंत्रणाकडे झुकलेली आहे.
CLM-8B कोणी जारी केले, आणि ते खरोखरच खुले आहे का?
जॅकी क्वोक यांनी या कामाची ओळख करून दिली; अझालिया मिर्होसेनी यांनी त्याला अधिक विस्तार दिला; या कव्हरेजमध्ये स्टॅनफोर्ड आणि एनव्हिडिया-संबंधित सांघिक प्रयत्नांचे वर्णन आहे, ज्यात संशोधकांची नावे, सार्वजनिक वेट्स आणि ओपन कोड समाविष्ट आहेत. या रिलीजचे लायसन्सिंग अपाचे २.० म्हणून मांडले आहे, जे फाइन-ट्यूनिंग आणि शिपिंगसाठी महत्त्वाचे आहे - परंतु कव्हरेज सारांशांवर अवलंबून राहण्यापूर्वी रेपोमधील लायसन्स फाइल्स वाचा. अनामिक डम्प्सच्या तुलनेत, नाव असलेल्या ओपन रिलीजची स्ट्रेस-टेस्टिंग अधिक वेगाने होते. व्यापक तृतीय-पक्ष प्रतिकृतीसाठी अजून खूप लवकर आहे.
एजेंटिक कोडिंगसाठी स्टेट-टू-ॲक्शन लूप इतके महत्त्वाचे का आहेत?
एजेंटिक कोडिंग बहुतेकदा बायनरी असते: चाचणी यशस्वी होते किंवा नाही, त्यामुळे सुंदर अपयश निबंधांपेक्षा सुस्पष्ट कृती निवड अधिक प्रभावी ठरते. अनेक टूल स्टेप्सवर लेटन्सी वाढत जाते - प्रत्येक स्टेपवर वेळ कमी केल्यास वॉल क्लॉक आणि क्लाउड बिल्स दोन्ही बदलतात. जेव्ह-क्लास समकक्षाच्या तुलनेत दहा पटींनी जास्त वेगाचा दावा, जरी प्रत्यक्षात तो "फक्त" ४ पट असला तरी, क्षमता नियोजनाची पुनर्रचना करतो. हायब्रीड स्टॅक्स - एक वेगवान सीएलएम-सारखा कंट्रोलर आणि कठीण शाखांवर एक अधिक शक्तिशाली रीझनर - हे एक वास्तववादी दीर्घकालीन स्वरूप आहे.
मी CLM-8B साठी DeepSWE आणि Terminal-Bench स्कोअरवर विश्वास ठेवावा का?
ते सूट्स कमकुवत एजंट्सना शिक्षा देतात, म्हणूनच थोड्याफार फाइन-ट्यूनिंगनंतर ~८१.६% डीपएसडब्ल्यूई (DeepSWE) आणि ~८७.६% टर्मिनल-बेंच २.१ (Terminal-Bench 2.1) उत्साहवर्धक दिसतात. एजेंटिक बेंचेस पायाभूत संरचनेलाही पुरस्कृत करतात: हार्नेसची गुणवत्ता, टूल अलाउलिस्ट्स आणि रिकव्हरी प्रॉम्प्ट्स यशात दुहेरी अंकांनी बदल घडवू शकतात. चार्टला अंतिम सत्य मानण्यापूर्वी, वेट्सभोवती कोणते आवरण होते याचा सखोल अभ्यास करा. जोपर्यंत कोणीतरी दस्तऐवजीकृत कृतींसह (documented recipes) त्यांची पुनरावृत्ती करत नाही, तोपर्यंत लेखक बेंचेस हे केवळ एक मार्केटिंगच असते.
CLM-35B आणि 8B मॉडेलच्या फाइन-ट्यूनिंगबद्दल मला काय माहिती असायला पाहिजे?
मोठ्या CLM-35B ची पुढील आवृत्ती एक योजना म्हणून उल्लेखली गेली आहे; ती लेटन्सीची समस्या कायम ठेवेल की डेप्थसाठी वेगाशी तडजोड करेल, हे अद्याप निश्चित नाही. तुमच्या स्वतःच्या लिंट रूल्स, डिप्लॉय CLI आणि मोनोरिपो ट्रेसेसवर CLM-8B ला फाइन-ट्यूनिंग करणे हाच उत्तम आकडेवारी मिळवण्याचा वास्तववादी मार्ग आहे - पहिल्याच दिवशी शून्य-शॉट जादू करणे नव्हे. जर दोन्ही आकार उपलब्ध झाले, तर संघ ते ठेवू शकतात: हॉट लूप्ससाठी 8B, आणि हार्ड प्लॅनिंगसाठी 35B. ओपन वेट्समुळे गैरवापर करणेही सोपे होते, त्यामुळे गार्डरेल्स आणि रेट लिमिट्स हे उत्पादन आहेत, ऐच्छिक कॉस्प्ले नव्हेत.
जेव्हच्या तुलनेकडे आकर्षित न होता मी ती कशी वाचावी?
जेव्ह-क्लास तुलना "९ पटींपर्यंत वेगवान" याला एक समकक्ष आधार देतात, ज्यामुळे सादरीकरण यशस्वी होण्यास मदत होते. बॅच साइज, अचूकता, संदर्भाची लांबी आणि टूल-कॉल सिरीअलायझेशन या सर्वांना एकाच गुणकामध्ये एकत्र करणे हा धोका आहे. जेव्हा चर्चेत ~३२ एमएस-क्लास प्रतिसादांचा उल्लेख येतो, तेव्हा विचारा की त्याचा अर्थ पहिला टोकन, संपूर्ण ॲक्शन JSON, की कॅश्ड प्रीफिक्स आहे. तुमच्या स्टॅकमधील टास्कचे यश, सोडवलेल्या प्रत्येक तिकीटमागे मिळालेली रक्कम आणि मानवी हस्तक्षेपाचा दर मोजा. स्पर्धेच्या चर्चा लॅब्सना आकडेवारी प्रकाशित करण्यास भाग पाडतात; पण निर्णय मात्र तुमचे प्रोडक्शन केपीआयच घेतात.
प्रोडक्शन एजंट्समध्ये CLM-8B वापरण्यापूर्वी बिल्डर्सनी काय करावे?
टर्मिनल मायक्रो-लूपसारखा, लेटन्सीसाठी महत्त्वाचा असलेला एक भाग वेगळा काढा आणि हार्नेस स्थिर ठेवून, तुमच्या सध्याच्या मुख्य प्रणालीसोबत त्याची A/B चाचणी करा. चुकीच्या पण जलद होणाऱ्या कृतींवर लक्ष ठेवा; पडताळणीची भर घाला, उलटवता येण्याजोग्या साधनांना प्राधान्य द्या आणि जेव्हा विश्वास कमी असेल तेव्हा एका धीम्या गतीच्या रिझनरसाठी बजेट ठेवा. केवळ प्रति सेकंद टोकन्सचीच नव्हे, तर प्रति GPU प्रति सेकंद होणाऱ्या कृतींचीही नोंद ठेवा. प्रायोगिक एजंट्समध्ये प्रोडक्शन सिक्रेट्स पेस्ट करू नका आणि जोपर्यंत तुमचे स्वतःचे रन्स यशस्वी होत नाहीत, तोपर्यंत प्रत्येक प्रेस चार्टवर 'क्लेम' स्टिकर लावून ठेवा.
CLM-8B जस्ट ड्रॉप्ड क्लेम्ससाठी मी एक योग्य लेटन्सी मायक्रो-लूप मूल्यांकन कसे तयार करू?
खऱ्या अयशस्वी-चाचणी ट्रेसचा एक छोटा संच गोठवा, सर्व मॉडेल्समध्ये समान टूल स्कीमा आणि अलाउलिस्ट ठेवा, आणि स्टेप्स, वॉल-क्लॉक, यश आणि मानवी हस्तक्षेप लॉग करा. जर तुम्ही नवीन तिकीट्ससाठी एक हेतुपुरस्सर सुटकेचा मार्ग ठेवत असाल, तर CLM-8B चा वापर फक्त "पुढील उलटवता येण्याजोगी कृती निवडा" या स्टेपवर करा. जोपर्यंत हे हार्नेस यश आणि लेटन्सी या दोन्हींमध्ये एकत्रितपणे विजय दाखवत नाही, तोपर्यंत लेखक ~9×, DeepSWE, आणि मिलिसेकंदच्या आकड्यांना CLAIM म्हणून लेबल करा. हे केंद्रित मूल्यांकन, केवळ स्लाईड डेकवर प्रोडक्शन कोड पुन्हा लिहिण्यापेक्षा अधिक चांगले आहे.
संदर्भ
- हगिंग फेस — कॉन्ट्रास्टिव्ह लँग्वेज मॉडेल (CLM-v0.1-8B) — huggingface.co
- गिटहब — कॉन्ट्रास्टिव्ह-एलएम / सीएलएम — github.com
- स्टॅनफोर्ड युनिव्हर्सिटी — अझलिया मिरहोसेनी — cs.stanford.edu
- जॅकी क्वोक — jackyk02.github.io
- एक्स — जॅकी क्वोक यांची ओळख — x.com
- DeepSWE — deepswe.datacurve.ai
- स्नॉर्केल एआय — टर्मिनल-बेंच २.१ — snorkel.ai
- जेव — jevtypesafeai.com