बैच प्रोसेसिंग

किसी भी संख्या में एंटिटीज़ को रियल-टाइम प्रगति ट्रैकिंग, स्वचालित मल्टी-मॉडल फ्यूज़न, और JSON या Excel में एक्सपोर्ट के साथ समानांतर रूप से संवर्धित करें — केवल आपके प्लान के उपयोग कोटा से बंधी, किसी निश्चित बैच साइज़ से नहीं।

इनपुट विधियाँ

पंक्तियाँ ग्रिड के ऊपर बनी सोर्स स्ट्रिप से आती हैं — तीन टैब, एक बार में एक ही खुला। पंक्तियाँ लोड होते ही स्ट्रिप सिमटकर एक ही लाइन रह जाती है (“पेस्ट / CSV · 12 पंक्तियाँ लोड हुईं”), ताकि ग्रिड की ऊँचाई बनी रहे; कोई दूसरा सेट लोड करने के लिए उस लाइन पर क्लिक करें।

  1. 1पेस्ट / CSV, फ़ाइल और URL — एक बार में एक ही स्रोत खुला रहता है
  2. 2बटन पंक्तियों को लोड करने से पहले उन्हें गिनता है
  3. 3पहचाने गए कॉलम की संख्या और हेडर रो
डिलिमिटर — कॉमा, टैब या सेमीकोलन — और हेडर पंक्ति आपके पेस्ट करते ही ब्राउज़र में तय हो जाते हैं, इसलिए गलत अनुमान एक भी पंक्ति लोड होने से पहले दिख जाता है।

पेस्ट / CSV

Excel, Google Sheets या किसी CSV एक्सपोर्ट से सीधे पंक्तियाँ पेस्ट करें। कॉमा, टैब और सेमीकोलन — तीनों समझे जाते हैं, कोट में लिखे सेल के भीतर डेलिमिटर हो सकता है, और अगर पहली पंक्ति में गैर-संख्यात्मक नाम हों तो उसे कॉलम हेडर मान लिया जाता है।

फ़ाइल

किसी .csv, .tsv या .json फ़ाइल को टैब पर ड्रॉप करें, या डिस्क से कोई चुनें। एक JSON फ़ाइल में ऑब्जेक्ट्स की एक array हो सकती है या एक अकेला ऑब्जेक्ट; कॉलम उनकी कीज़ का यूनियन होते हैं, इसलिए असमान रिकॉर्ड भी लोड हो जाते हैं।

URL

किसी भी REST एंडपॉइंट से एंटिटी लाएँ। जो कुछ भी वापस आता है उसे फ़्री-फ़ॉर्म ऑब्जेक्ट्स की सूची के रूप में पढ़ा जाता है, और कॉलम सेट उनकी कीज़ का यूनियन होता है।

समर्थित प्रमाणीकरण:

कोई नहींBearer टोकनAPI कुंजी हेडरबेसिक Auth

यदि API कोई ऑब्जेक्ट लौटाता है, तो सिस्टम एम्बेडेड array के लिए data, results, items जैसी कुंजियों की जाँच करता है।

Entity चयन और सत्यापन

एंटिटीज़ लोड होने के बाद, वे वैलिडेशन स्थिति के साथ एक चयन योग्य सूची में दिखाई देती हैं। आप चुन सकते हैं कि बैच में कौन-सी एंटिटीज़ शामिल करनी हैं:

मल्टी-सिलेक्ट— पंक्तियों को एक-एक करके टिक करें, या सभी के लिए हेडर बॉक्स पर; Ctrl+A मौजूदा फ़िल्टर में दिख रही हर चीज़ चुन लेता है। किसी पंक्ति पर क्लिक करने से चयन नहीं बदलता, बल्कि उसका परिणाम ड्रॉअर खुलता है।
इनलाइन संपादन— किसी भी इनपुट सेल पर डबल-क्लिक करके वहीं वैल्यू ठीक करें — आपके डेटा के साथ आया हर कॉलम एडिट किया जा सकता है, केवल स्कीमा की सर्च कीज़ ही नहीं।
सत्यापन— आपकी पंक्तियों में स्कीमा के फ़ील्ड नाम इस्तेमाल करना ज़रूरी नहीं — मॉडल उन्हें जैसे हैं वैसे ही पढ़ते हैं। ग्रिड सिर्फ़ एक ही फ़ैसला सुनाता है: खालीपन का। जिस पंक्ति में कोई भी मान नहीं होता, उसे चिह्नित कर धूसर कर दिया जाता है और रन से बाहर रखा जाता है। ग़लत प्रकार की एंटिटी अपने आप हटाने के लिए कोई क्लासिफ़िकेशन मॉडल चुनें।
चयनात्मक प्रोसेसिंग— enrichment के लिए केवल चयनित entities भेजी जाती हैं। जिन entities को आप प्रोसेस नहीं करना चाहते, उन्हें अचयनित करें।
प्रति पंक्ति कॉन्ट्रैक्ट जाँच— सर्वर कुछ भी खर्च करने से पहले हर पंक्ति को स्कीमा के इनपुट कॉन्ट्रैक्ट के विरुद्ध जाँचता है, और पहली गड़बड़ी पर रुकने के बजाय हर दोषपूर्ण पंक्ति की रिपोर्ट देता है — ताकि आप पूरे बैच को एक ही बार में ठीक कर सकें।
  1. 1हर पंक्ति के टिक बॉक्स तय करते हैं कि रन किन पर खर्च करेगा
  2. 2खाली पंक्ति यहाँ चिह्नित है — और रन से हटा दी गई है
  3. 312 चुनी गईं — पर सिर्फ़ 11 ही चलाई जा सकती हैं
पंक्ति 11 में कोई नाम नहीं है, सिर्फ़ एक देश और एक टिकर, फिर भी उसे एनरिच किया जाता है: गुम सर्च की के साथ मॉडल काम चला लेते हैं, खाली पंक्ति के साथ नहीं। यहाँ इनपुट, वैलिडेशन और रन स्थिति एक ही पंक्ति में हैं, तीन अलग-अलग सूचियों में नहीं।

कॉन्फ़िगरेशन

साइडबार सिंगल एनरिचमेंट कॉन्फ़िगरेशन विकल्पों को दर्शाता है:

विकल्पविवरण
स्कीमालक्ष्य schema जो enrichment आउटपुट संरचना को परिभाषित करता है
रणनीतिसिंगल पास, एक्सपर्ट डोमेन, या मल्टी-एक्सपर्टीज़ (प्रति डोमेन पैरेलल कॉल)
मॉडलप्रति entity चलाने के लिए एक या अधिक AI models। कई models स्वचालित fusion को सक्षम करते हैं।
भाषाएँबहुभाषी फ़ील्ड संवर्धन के लिए भाषाएँ (जैसे, अंग्रेज़ी + फ़्रेंच)
क्लासिफिकेशनएनरिचमेंट से पहले एंटिटी प्रकार सत्यापन के लिए वैकल्पिक तेज़ मॉडल
आर्बिट्रेशनफ़्यूज़न के दौरान LLM-आधारित संघर्ष समाधान के लिए मॉडल। यदि अनसेट है, तो नियम-आधारित मर्ज का उपयोग किया जाता है।

लागत अनुमान

अनुमानित लागत रन बार में दिखती है, ठीक उस बटन के पास जो इसे खर्च करता है। इसकी गणना आपके स्कीमा की प्रॉपर्टी संख्या, चयनित मॉडलों के टोकन मूल्य निर्धारण, और आपके द्वारा चुनी गई एंटिटी की संख्या से की जाती है। स्वचालित मॉडल चयन के साथ मॉडल तभी चुना जाता है जब रन शुरू होता है, इसलिए दिखाया गया आंकड़ा उन सभी मॉडलों का माध्यिका होता है जिन्हें यह चुन सकता है। पुष्टिकरण डायलॉग हर रन पर नहीं, बल्कि तभी दिखता है जब रन में वास्तविक जोखिम हो — यह किसी लिंक किए गए डेटाबेस में लिखता हो, अनुमान बड़ा हो, या चयनित पंक्तियां छोड़ी जाने वाली हों।

  1. 1दो मॉडल: प्रति एंटिटी, हर एक की एक कॉल
  2. 2अनुमान, जो चयन बदलते ही फिर से गणना किया जाता है
  3. 311 एंटिटी, लोड की गई 12 नहीं — खाली रो हटा दी जाती है
बटन बताता है कि वह क्या चलाने वाला है, ताकि संख्या और कीमत एक साथ पढ़ी जा सकें। फ़ोन ब्रेकपॉइंट से नीचे पिकर “More options” में सिमट जाते हैं और अनुमान बटन के बगल में ही रहता है।

समानांतर निष्पादन

सभी चयनित एंटिटी एक साथ प्रोसेस की जाती हैं। प्रत्येक एंटिटी स्वतंत्र रूप से पूरी एनरिचमेंट पाइपलाइन से गुज़रती है:

प्रति-entity पाइपलाइन

  1. क्लासिफिकेशन (वैकल्पिक) — एक तेज़ मॉडल एंटिटी प्रकार की पुष्टि करता है। बैच मोड में, बेमेल जॉब को रोकते नहीं हैं; कॉन्टेक्स्ट आगे भेज दिया जाता है।
  2. मल्टी-मॉडल संवर्धन — चुना गया हर मॉडल एंटिटी को समानांतर में संवर्धित करता है, हर एक अपनी कुंजी के रेट बजट के भीतर गति-नियंत्रित।
  3. ऑटो-फ्यूज़न (जब 2+ मॉडल सफल होते हैं) — संघर्ष पहचान और समाधान का उपयोग करके परिणाम स्वचालित रूप से मर्ज किए जाते हैं।

रेट पेसिंग

सभी एंटिटी हर API कुंजी और मॉडल का रेट बजट साझा करती हैं — यानी प्रति मिनट अनुरोध और टोकन जो प्रोवाइडर उस कुंजी को देता है, जो उसके रिस्पॉन्स से पढ़ा जाता है या किसी अस्वीकृति से सीखा जाता है। 20 एंटिटी और 2 मॉडल के साथ, जो मॉडल 15 अनुरोध प्रति मिनट की अनुमति देता है उसकी कॉल पूरे मिनट में फैला दी जाती हैं जबकि दूसरा मॉडल अपनी गति से चलता है, इसलिए बैच बिना 429 त्रुटियों के पूरा होता है।

रीयल-टाइम प्रगति

रन शुरू करने पर टूलबार और ग्रिड के बीच एक रन स्ट्रिप खुलती है, जो Server-Sent Events (SSE) से चलती है: बैच के लिए एक प्रोग्रेस बार, done / failed / skipped एक मिले-जुले आंकड़े के बजाय अलग-अलग काउंटर के रूप में, बीता हुआ समय और पहले से पूरी हो चुकी पंक्तियों से निकाला गया ETA, और प्री-फ़्लाइट अनुमान के मुकाबले अब तक का खर्च। ग्रिड के ऊपर कुछ नहीं खुलता — पंक्तियाँ वहीं रहती हैं जहाँ आपने उन्हें छोड़ा था, और हर पंक्ति अपनी स्थिति Status कॉलम में रखती है, उसमें लगे Time और Cost के साथ।

नहीं चलाया गया

यह पंक्ति अभी किसी रन से नहीं गुज़री है — स्थिति सेल पूरे कॉलम में ख़ुद को दोहराने के बजाय एक डैश दिखाता है।

कतार में

बैच में स्वीकृत, कुंजी के रेट बजट में जगह की प्रतीक्षा में।

चल रहा है

लेबल की जगह एक इनलाइन बार आ जाता है, जो कुल में से पूरे हो चुके विशेषज्ञता डोमेन चरणों की गिनती दिखाता है।

पूर्ण

हर मॉडल ने जवाब दे दिया। समय और लागत भर जाते हैं, और Result कॉलम पढ़ने लायक हो जाते हैं।

विफल

इस पंक्ति के लिए किसी भी मॉडल ने परिणाम नहीं दिया। बैच रुकने के बाद स्ट्रिप सिर्फ़ विफल पंक्तियों को दोबारा चलाने का विकल्प देती है।

छोड़ा गया

एनरिचमेंट से पहले ही हटा दिया गया — जैसे कि एक निश्चित क्लासिफिकेशन बेमेल — इसलिए इस रो की कोई लागत नहीं आई।

टूलबार के पूर्ण / विफल / छोड़े गए चिप ग्रिड को उन्हीं पंक्तियों तक सीमित कर देते हैं, और इनपुट / दोनों / परिणाम स्विच उन्हीं पंक्तियों को आपके भेजे गए डेटा, वापस आए डेटा, या दोनों को साथ-साथ दिखाता है।

रद्दीकरण और त्रुटि प्रबंधन

आप किसी भी समय चल रहे batch को रद्द कर सकते हैं। रद्दीकरण सहयोगात्मक है — पहले से प्रक्रिया में मौजूद entity अपना मौजूदा LLM कॉल पूरा करती हैं, लेकिन कोई नया कॉल शुरू नहीं होता। पूर्ण हुई entity के आंशिक परिणाम संरक्षित रहते हैं।

त्रुटि लचीलापन

बैच प्रोसेसिंग को लचीला बनाने के लिए डिज़ाइन किया गया है। व्यक्तिगत विफलताएँ बैच को नहीं रोकतीं:

  • यदि किसी एंटिटी के लिए वर्गीकरण विफल हो जाता है, तो एनरिचमेंट बिना संदर्भ के आगे बढ़ता है
  • यदि एक मॉडल विफल होता है, तो उस एंटिटी के अन्य मॉडल जारी रहते हैं
  • दो या अधिक मॉडल होने पर, स्वचालित फ़्यूज़न केवल उन एंटिटीज़ के लिए चलता है जहाँ हर मॉडल सफल रहा हो — अधूरी एंटिटी से कोई फ़्यूज़ किया गया परिणाम नहीं बनता, और जब तक छूटे हुए मॉडल की असफल विशेषज्ञता क्षेत्रों को दोबारा चलाकर रिकवर नहीं किया जाता, तब तक आपके डेटाबेस तक कुछ नहीं पहुँचता
  • यदि किसी एंटिटी के लिए सभी मॉडल विफल हो जाते हैं, तो उसे विफल के रूप में चिह्नित किया जाता है जबकि अन्य जारी रहते हैं
  • “not found” त्रुटि लौटाने वाले मॉडल स्वतः निष्क्रिय कर दिए जाते हैं

एक्सपोर्ट फॉर्मेट

बैच पूरा होने के बाद, परिणामों को तीन फ़ॉर्मैट में एक्सपोर्ट करें। प्रत्येक एंटिटी के लिए, यदि उपलब्ध हो तो फ्यूज़न परिणाम को प्राथमिकता दी जाती है; अन्यथा, सर्वश्रेष्ठ मॉडल परिणाम का उपयोग किया जाता है।

JSON फ़ाइल

सभी एंटिटी डेटा, मॉडल आउटपुट और फ्यूज़न मेटाडेटा सहित पूरे परिणामों को एक संरचित JSON फ़ाइल के रूप में डाउनलोड करें।

क्लिपबोर्ड

JSON परिणामों को सीधे अपने क्लिपबोर्ड पर कॉपी करें ताकि उन्हें अन्य टूल या स्क्रिप्ट में पेस्ट किया जा सके।

Excel

एक तीन-शीट वर्कबुक: Results (प्रति entity एक पंक्ति, समतल की गई प्रॉपर्टीज़ के साथ), Summary (batch मेटाडेटा, models, लागतें), और Conflicts (समाधान तर्क सहित प्रति-entity विरोध विवरण)।

सीमाएँ

सीमामान
प्रति batch अधिकतम entitiesकोई निश्चित सीमा नहीं — आपके प्लान के उपयोग कोटा से बंधी
अधिकतम entity डेटा आकार50,000 अक्षर
अधिकतम prompt लंबाई100,000 वर्ण
URL फ़ेच टाइमआउट30 सेकंड

अगले चरण