मॉडल बेंचमार्क - Entity Enricher दस्तावेज़ीकरण

मॉडल बेंचमार्क

बेंचमार्क सिनेरियो आपको एक वास्तविक, दोहराने योग्य एनरिचमेंट कार्य पर LLM मॉडल्स की तुलना करने देते हैं — एक जैसे बनाम एक जैसे — प्रत्येक मॉडल के आउटपुट और कुल लागत को कैप्चर करते हुए ताकि आप कार्य के लिए सही मॉडल चुन सकें।

बेंचमार्क क्यों?

मॉडल सटीकता, संरचित-आउटपुट विश्वसनीयता और मूल्य में बहुत भिन्न होते हैं। अनुमान लगाने के बजाय, एक बेंचमार्क परिदृश्य एक ही स्कीमा और एंटिटी को एक साथ कई मॉडलों के माध्यम से चलाता है और रिकॉर्ड करता है कि प्रत्येक ने क्या तैयार किया और उसकी लागत क्या रही। आप साक्ष्य के आधार पर तुलना करते हैं, फिर उस सबसे सस्ते मॉडल को लॉक कर देते हैं जो आपके गुणवत्ता मानक पर खरा उतरता है।

यह कैसे काम करता है

1
एक सिनेरियो परिभाषित करें

एक benchmark scenario एक सेव किया गया, पुनः उपयोग योग्य model test है। यह enrichment (एक schema, एक fixed entity input, एक enrichment strategy, languages, response-schema / strict-structured-output toggles, और कोई भी attachments), sample generation (एक entity-type description जिसे हर model एक example JSON में बदलता है), या schema generation (एक fixed sample JSON जिसे हर model एक schema में बदलता है) को benchmark कर सकता है। यह अपना gold reference और परिणामों को उसके विरुद्ध कैसे ग्रेड किया जाता है (एक judge model, एक embedding model, और एक strictness threshold — sample generation को केवल judge द्वारा rubric-scored किया जाता है, बिना किसी reference के) भी रखता है। इसे एक बार परिभाषित करें और जिस भी model की तुलना करनी हो उस पर पुनः उपयोग करें।

2
इसे मॉडलों में रन करें

जब परिदृश्य के पास वेरिफाइड रेफरेंस हो, तो इसे किसी एक प्रोवाइडर के सक्रिय मॉडल या व्यू में मौजूद हर सक्रिय मॉडल के विरुद्ध चलाएँ। हर मॉडल स्वतंत्र रूप से संवर्धित होता है — कोई फ्यूजन नहीं — इसलिए आपको प्रति मॉडल एक साफ़, साथ-साथ रखा गया परिणाम मिलता है। प्रगति लाइव स्ट्रीम होती है, और जैसे ही रन समाप्त होता है, हर सफल परिणाम रेफरेंस के विरुद्ध स्वचालित रूप से स्कोर किया जाता है। अगर परिदृश्य में बाइनरी अटैचमेंट हैं, तो ऐसे मॉडल छोड़ दें जो अटैचमेंट नहीं पढ़ सकते को सक्षम करें, और जिन मॉडलों में आवश्यक फ़ाइल क्षमता नहीं है उन्हें गारंटीड विफलताएँ उत्पन्न करने के बजाय छोड़ा गया के रूप में रिपोर्ट किया जाता है।

3
output और लागत की तुलना करें

हर रन अपने स्ट्रक्चर्ड आउटपुट, सफलता स्थिति, टोकन गिनती, प्रोसेसिंग समय, और कुल बिल की गई लागत के साथ सहेजा जाता है। JSON आउटपुट का निरीक्षण करने या अंतर्निहित संवर्धन रिकॉर्ड पर जाने के लिए किसी भी पंक्ति को विस्तृत करें।

4
रिफ्रेश करने के लिए फिर से चलाएँ

उसी मॉडल पर कोई सिनारियो दोबारा चलाने से उसका पिछला परिणाम ओवरराइटहो जाता है, इसलिए टेबल हमेशा नवीनतम रन दिखाती है। किसी सिनारियो का कॉन्फ़िग एडिट करने पर पुराने परिणाम बासी के रूप में चिह्नित हो जाते हैं, जब तक आप उन्हें दोबारा नहीं चलाते। प्रति मॉडल रन को 2 या 3 पर सेट करें और हर मॉडल का उतनी ही बार बेंचमार्क होगा — टेबल में लागत, गुणवत्ता और गति का औसत रहता है, साथ में एक कंसिस्टेंसी रेंज (मॉडल हर रन में अलग-अलग नतीजे देते हैं), और क्रेडिट भी लगभग उसी गुणा में लगते हैं। बड़ी रेंज की वजह अक्सर मॉडल नहीं, बल्कि ऐसी स्कीमा प्रॉपर्टीज़ होती हैं जो एक से ज़्यादा सवाल पूछती हैं — अस्पष्टता जाँच उन्हें ढूँढकर ठीक करती है।

परिणाम पढ़ना

रिज़ल्ट टेबल तुलना के लिए बनाई गई है। ऊपर एक सारांश पट्टी सफलता दर और सफल हुए सबसे सस्ते तथा सबसे तेज़ मॉडल को दर्शाती है। हर कॉलम — मॉडल, स्टेटस, स्ट्रैटेजी, लागत, टोकन और समय — सॉर्ट करने योग्य है, इसलिए एक क्लिक में मॉडल कीमत या लेटेंसी के अनुसार रैंक हो जाते हैं। मॉडल नाम, स्टेटस या स्ट्रैटेजी के अनुसार फ़िल्टर करके दृश्य को सीमित करें, और पूरा स्ट्रक्चर्ड आउटपुट पढ़ने या अंतर्निहित एनरिचमेंट रिकॉर्ड खोलने के लिए किसी भी पंक्ति का विस्तार करें।

नतीजों को वापस फ़ीड करना: स्कोरिंग सोर्स

बेंचमार्क का मूल्य एक बार पढ़ी गई तालिका से कहीं ज़्यादा है। किसी परिदृश्य को स्कोरिंग स्रोत के रूप में चिह्नित करें और उसके प्रति-मॉडल परिणाम प्लेटफ़ॉर्म को चलाने लगते हैं: हर पिकर में मॉडल आपके मापे गए स्कोर बैज के रूप में दिखाते हैं, पिकर उन्हीं से क्रमबद्ध होते हैं, और स्वचालित मॉडल चयन उसी मॉडल पर पहुँचता है जिसे उस कार्य के लिए आपके अपने मापन सबसे ऊपर रखते हैं। कई को चिह्नित करें तो स्कोर का औसत लिया जाता है — यानी “सर्वश्रेष्ठ मॉडल” का अर्थ है आपके स्कीमा पर सर्वश्रेष्ठ, किसी सार्वजनिक लीडरबोर्ड पर नहीं। सिस्टम एडमिनिस्ट्रेटर एक वैश्विक परिदृश्य प्रकाशित कर सकते हैं, जो उन संगठनों के लिए फ़ॉलबैक बनता है जिनके पास अपना कोई नहीं है।

“सर्वश्रेष्ठ” का पैमाना क्या हो, यह आप तय करते हैं: क्वालिटी, स्पीड और लागत का मिश्रण Settings → Organization → Defaults के अंतर्गत हर सिनेरियो टाइप के लिए कॉन्फ़िगर किए गए अनुपात से तय होता है (हर अनुपात का योग 100, डिफ़ॉल्ट रूप से एक-एक तिहाई)। बैच लागत के लिए ऑप्टिमाइज़ करने वाली टीम और जवाब की क्वालिटी के लिए ऑप्टिमाइज़ करने वाली टीम एक ही बेंचमार्क से जायज़ तौर पर अलग-अलग मॉडल ऑटो-सिलेक्ट करेंगी।

पुनरावृत्ति: पुनः प्रयास करें और अक्षम करें

बेंचमार्किंग इटरेटिव है। चेकबॉक्स से पंक्तियों को टिक करें (रेंज के लिए shift-click करें), फिर सब कुछ दोबारा चलाए बिना किसी सबसेट पर कार्रवाई करने के लिए ··· मेन्यू का उपयोग करें:

एक gold reference सेट करें (benchmark के लिए आवश्यक)

हर परिदृश्य में एक संदर्भ परिणाम होता है — इसकी एंटिटी के लिए अपेक्षित आउटपुट — और किसी परिदृश्य को केवल तभी बेंचमार्क किया जा सकता है जब वह संदर्भ सत्यापित हो। तब तक यह किसी भी रन मेनू में नहीं दिखेगा। संदर्भ गुणवत्ता आँकने का आधार है: हर मॉडल फ़ील्ड-दर-फ़ील्ड कितना करीब पहुँचता है, और (किसी फ़िल्म की कास्ट जैसी सूचियों के लिए) उसने वास्तव में कितने सही आइटम खोजे। आप इसे — इसके साथ इस्तेमाल किए गए जज मॉडल, एम्बेडिंग मॉडल, और सख्ती के साथ — परिदृश्य संपादक में ही सेट करते हैं।

इसे दो तरीकों से बनाएं। इसे Generate करें: एक ऐसा डॉक्युमेंट अटैच करें जिसमें सही मान हों (एक डेटाशीट, एक आधिकारिक पेज), वेब सर्च चालू करें, और कुछ मजबूत मॉडल चलाएं — वे स्मृति के बजाय आपके स्रोत से उत्तर निकालते हैं, इसलिए परिणाम अनुमान पर नहीं, बल्कि सच्चाई पर आधारित होता है। या कोई ज्ञात-सही परिणाम जो आपके पास पहले से है उसे paste करें। किसी भी तरह से आप JSON की समीक्षा करते हैं, कुछ भी सुधारते हैं, और उसे verified के रूप में चिह्नित करते हैं — एक स्पष्ट सहमति कि यही गोल्ड उत्तर है।

क्योंकि रेफरेंस को आधार-सहित तैयार किया जाता है और एक बार मानव द्वारा जाँचा जाता है, यह एक भरोसेमंद मापदंड के रूप में भी काम करता है जिसे आप हर मॉडल और हर भविष्य के रन में दोबारा उपयोग करते हैं।

इसे कहां खोजें

बेंचमार्क Model Management → Benchmarks में रहते हैं (संगठन के मालिकों और एडमिन के लिए उपलब्ध)। वहाँ परिदृश्य बनाएँ और प्रबंधित करें, या चार जगहों में से किसी से भी रन लॉन्च करें: टूलबार में Benchmark models बटन (व्यू में सभी सक्रिय मॉडल), किसी भी provider पंक्ति पर Benchmark models क्रिया (उस provider के सक्रिय मॉडल), Models पैनल में मॉडल चुनने पर दिखने वाला Benchmark ड्रॉपडाउन (चुने गए मॉडल), या किसी एकल मॉडल पंक्ति पर Benchmark model क्रिया।

किसी परिदृश्य पर Run और परिणाम स्कोर करें बटन डिफ़ॉल्ट रूप से इंक्रीमेंटल रूप से काम करते हैं — वे केवल उन मॉडलों को लक्षित करते हैं जिनका अभी तक कोई परिणाम नहीं है, साथ ही पुराने परिणाम (और स्कोरिंग के समय बिना स्कोर वाले या पुराने स्कोर)। कन्फर्मेशन डायलॉग आपको पूर्ण री-रन के लिए स्कोप को हर सक्रिय मॉडल तक विस्तृत करने देता है, या पुरानी प्रविष्टियों को बाहर करने के लिए इसे सीमित करने देता है। परिणाम तालिका का दिखाए गए मॉडल फ़िल्टर उन सक्रिय मॉडलों को भी सूचीबद्ध कर सकता है जिन्हें अभी तक बेंचमार्क नहीं किया गया है।

लागत और बिलिंग

बेंचमार्क रन वास्तविक LLM कॉल्स करते हैं और वास्तविक उपयोग के आधार पर क्रेडिट काटते हैं, ठीक एक सामान्य एनरिचमेंट की तरह। पुष्टिकरण डायलॉग आपको बताता है कि कोई खर्च होने से पहले आप कितने मॉडल्स चलाने वाले हैं। प्रत्येक सहेजा गया परिणाम अपनी बिल की गई लागत दिखाता है, इसलिए बेंचमार्क लागत-तुलना उपकरण के रूप में भी काम करता है।