تتيح لك سيناريوهات اختبار الأداء المرجعي مقارنة نماذج الـ LLM على مهمة إثراء حقيقية وقابلة للتكرار — على قدم المساواة — مع التقاط مخرجات كل نموذج وتكلفته الإجمالية لتختار النموذج المناسب للمهمة.
تختلف النماذج اختلافًا كبيرًا في الدقة وموثوقية المخرجات المُهيكلة والسعر. بدلًا من التخمين، يُشغّل سيناريو المعيار المرجعي نفس المخطط والكيان عبر العديد من النماذج دفعة واحدة ويُسجّل ما أنتجه كل منها وتكلفته. تقارن بناءً على الأدلة، ثم تعتمد النموذج الأرخص الذي يفي بمعيار الجودة لديك.
سيناريو القياس المرجعي هو اختبار نماذج محفوظ وقابل لإعادة الاستخدام. يمكنه قياس الإثراء (مخطط، ومُدخل كيان ثابت، واستراتيجية إثراء، ولغات، ومفاتيح تبديل مخطط الاستجابة / المخرجات المهيكلة الصارمة، وأي مرفقات)، أو توليد العينات (طلب عينة بنص حر يحوّله كل نموذج إلى JSON نموذجي)، أو توليد المخطط (من عينة إدخال واحدة إلى عشرين عينة من نوع كيان واحد، يحوّلها كل نموذج إلى مخطط — ويمكن استيرادها، مع المخطط نفسه كمسودة مرجع، من مخطط محفوظ). كما يحتفظ بـمرجعه الذهبي وبطريقة تقييم النتائج مقابله (نموذج حَكَم، ونموذج تضمينات، وعتبة صرامة — أما توليد العينات فيُقيَّم بمعيار وصفي من الحَكَم وحده، دون مرجع). عرّفه مرة واحدة وأعد استخدامه مع كل نموذج تريد مقارنته.
بمجرد أن يمتلك السيناريو مرجعاً موثّقاً، شغّله مقابل النماذج النشطة لمزوّد واحد أو كل نموذج نشط ضمن العرض. يُثرى كل نموذج على حدة — دون دمج — لتحصل على نتيجة نظيفة جنباً إلى جنب لكل نموذج. يُبثّ التقدّم مباشرةً، وتُقيَّم كل نتيجة ناجحة تلقائياً مقابل المرجع عند انتهاء التشغيل. إذا كان السيناريو يحمل مرفقات ثنائية، فعّل تخطّي النماذج التي لا يمكنها قراءة المرفقات فتُبلَّغ النماذج التي تفتقر إلى قدرة الملفات المطلوبة على أنها مُتخطّاة بدلاً من إنتاج إخفاقات مؤكدة.
يُحفَظ كل تشغيل مع مخرجاته المنظّمة، وحالة نجاحه، وأعداد الرموز، ووقت المعالجة، وإجمالي التكلفة المُحاسَب عليها. وسّع أي صف لفحص مخرجات JSON أو الانتقال إلى سجل الإثراء الأساسي.
إعادة تشغيل سيناريو على النموذج نفسه تكتب فوق نتيجته السابقة، فيعكس الجدول دائمًا آخر تشغيل. وإذا عدّلت إعدادات سيناريو، تُعلَّم النتائج الأقدم بأنها قديمة حتى تعيد تشغيلها. اضبط عدد التشغيلات لكل نموذج على 2 أو 3، فيُقاس كل نموذج مرجعيًا بهذا العدد من المرات — ويحتفظ الجدول بمتوسط التكلفة والجودة والسرعة إضافة إلى مدى الاتساق (فالنماذج تتفاوت من تشغيل لآخر)، بما يقارب ذلك المضاعف من الأرصدة. وكثيرًا ما يعود التفاوت الواسع إلى خصائص في المخطط تطرح أكثر من سؤال واحد لا إلى النموذج — وفحص الالتباس يكتشف تلك الخصائص ويصلحها.
جدول النتائج مُصمّم للمقارنة. يبرز شريط ملخّص في الأعلى معدّل النجاح والأرخص والأسرع من النماذج التي نجحت. كل عمود — النموذج، الحالة، الاستراتيجية، التكلفة، الرموز، والوقت — قابل للفرز، فنقرة واحدة تُرتّب النماذج حسب السعر أو زمن الاستجابة. صفِّ حسب اسم النموذج أو الحالة أو الاستراتيجية لتضييق العرض، ووسّع أي صف لقراءة المخرجات المُهيكلة كاملة أو لفتح سجل الإثراء الأساسي.
الاختبار المرجعي أثمن من جدول تقرأه مرة واحدة. حدِّد سيناريو بوصفه مصدر تقييم فتبدأ نتائجه لكل نموذج في توجيه المنصة: تحمل النماذج درجاتك المقاسة كشارات في كل قائمة اختيار، وتُرتَّب القوائم بحسبها، ويؤدي الاختيار التلقائي للنموذج إلى النموذج الذي تصنّفه قياساتك أنت الأعلى لتلك المهمة. حدِّد عدة سيناريوهات فيُحسب متوسط الدرجات — فيصير معنى «أفضل نموذج» الأفضل على مخططاتك أنت، لا على لوحة صدارة عامة. ويمكن لمسؤولي النظام نشر سيناريو عام ليكون البديل الاحتياطي للمؤسسات التي ليس لديها سيناريو خاص بها.
أنت من يحدّد ما يزنه «الأفضل»: تمتزج الجودة والسرعة والتكلفة بنسبة تُضبط لكل نوع سيناريو ضمن الإعدادات → المؤسسة → الافتراضات (بمجموع 100، والثلث لكل منها افتراضيًا). ففريق يُحسّن لتكلفة الدفعات وفريق يُحسّن لجودة الإجابة سيختاران تلقائيًا — وعن حق — نماذج مختلفة من الاختبار المرجعي نفسه.
الاختبار المرجعي عملية تكرارية. انقر الصفوف لتحديدها (Ctrl/Cmd + نقر للتبديل، وShift + نقر لتحديد نطاق، أو تحديد الكل من قائمة ···)، ثم نفّذ الإجراءات على تلك المجموعة دون إعادة تشغيل كل شيء:
يحمل كل سيناريو نتيجة مرجعية — أي المخرجات المتوقعة لكيانه — ولا يمكن قياس أداء السيناريو إلا بعد التحقق من هذه النتيجة المرجعية. وحتى ذلك الحين لن يظهر في أي قائمة تشغيل. والمرجع هو الأساس للحكم على الجودة: إلى أي مدى يقترب كل نموذج، حقلاً بحقل، و(بالنسبة للقوائم مثل طاقم فيلم) كم عدد العناصر الصحيحة التي عثر عليها فعلاً. أنت تحدّده — إلى جانب نموذج الحكم، ونموذج التضمين، وصرامة التقييم المستخدمة في التقدير مقابله — مباشرةً في محرّر السيناريو.
أنشئه بطريقتين. ولّده: أرفق مستندًا يحتوي على القيم الصحيحة (ورقة بيانات، صفحة رسمية)، وفعّل البحث على الويب، وشغّل بضعة نماذج قوية — فهي تستخرج الإجابة من مصدرك لا من الذاكرة، ليكون الناتج مستندًا إلى الحقيقة لا إلى التخمين. أو الصق نتيجة معروفة الصحة لديك بالفعل. في كلتا الحالتين تراجع الـ JSON، وتصحّح ما يلزم، وتضع عليه علامة مُتحقَّق منه — إقرار صريح بأن هذه هي الإجابة الذهبية.
بما أن المرجع مؤسَّس على وقائع وخضع لتحقق بشري مرة واحدة، فإنه يعمل أيضًا كمقياس موثوق تعيد استخدامه عبر كل نموذج وكل تشغيل مستقبلي.
تتوفّر قياسات الأداء في إدارة النماذج → قياسات الأداء(متاحة لمالكي المؤسسة والمشرفين). أنشئ السيناريوهات وأدرها هناك، أو ابدأ تشغيلًا من علامة تبويب النماذج عبر زر قياس أداء النماذجفي شريط الأدوات: اختر سيناريو، ثم حدّد النطاق — المزودون أو النماذج التي حددتها (يعرض الزر عددها)، أو النماذج التي لم يُقَس أداؤها مطلقًا أو قيس أداؤها بإعداد سيناريو أقدم، أو كل نموذج نشط ظاهر في العرض.
يعمل زرّا تشغيل وتقييم النتائج في السيناريو بشكل تراكمي افتراضيًا — إذ يستهدفان فقط النماذج التي لا نتيجة لها بعد إضافةً إلى النتائج المتقادمة (والتقييمات غير المنجزة أو المتقادمة عند التقييم). ويتيح لك مربع التأكيد توسيع النطاق ليشمل كل نموذج نشط لإعادة تشغيل كاملة، أو تضييقه لاستبعاد العناصر المتقادمة. كما يمكن لمرشِّح النماذج المعروضة في جدول النتائج أن يعرض النماذج النشطة التي لم تخضع لقياس الأداء بعد.
تُجري عمليات اختبار الأداء المرجعي استدعاءات LLM حقيقية وتخصم أرصدة بناءً على الاستخدام الفعلي، تمامًا كأي إثراء عادي. يخبرك مربع حوار التأكيد بعدد النماذج التي أنت على وشك تشغيلها قبل أن يُصرف أي رصيد. تعرض كل نتيجة محفوظة تكلفتها المُحتسبة، فيغدو اختبار الأداء المرجعي أيضًا أداة لمقارنة التكاليف.