معايير أداء النماذج - وثائق Entity Enricher

معايير أداء النماذج

تتيح لك سيناريوهات اختبار الأداء المرجعي مقارنة نماذج الـ LLM على مهمة إثراء حقيقية وقابلة للتكرار — على قدم المساواة — مع التقاط مخرجات كل نموذج وتكلفته الإجمالية لتختار النموذج المناسب للمهمة.

لماذا القياس المرجعي؟

تختلف النماذج اختلافًا كبيرًا في الدقة وموثوقية المخرجات المُهيكلة والسعر. بدلًا من التخمين، يُشغّل سيناريو المعيار المرجعي نفس المخطط والكيان عبر العديد من النماذج دفعة واحدة ويُسجّل ما أنتجه كل منها وتكلفته. تقارن بناءً على الأدلة، ثم تعتمد النموذج الأرخص الذي يفي بمعيار الجودة لديك.

كيف يعمل

1
تعريف سيناريو

سيناريو قياس الأداء هو اختبار نموذج محفوظ وقابل لإعادة الاستخدام. يمكنه قياس أداء الإثراء (مخطط، ومدخل كيان ثابت، واستراتيجية إثراء، ولغات، ومفاتيح مخطط الاستجابة / المخرجات المنظمة الصارمة، وأي مرفقات)، أو توليد العينة (وصف لنوع كيان يحوّله كل نموذج إلى مثال JSON)، أو توليد المخطط (عينة JSON ثابتة يحوّلها كل نموذج إلى مخطط). كما يحتفظ بـمرجعه الذهبي وكيفية تقييم النتائج مقابله (نموذج محكّم، ونموذج تضمين، وعتبة صرامة — أما توليد العينة فيُقيَّم بمعيار تقييم من المحكّم وحده، دون مرجع). عرّفه مرة واحدة وأعد استخدامه عبر كل نموذج تريد مقارنته.

2
شغّله عبر النماذج

بمجرد أن يمتلك السيناريو مرجعاً موثّقاً، شغّله مقابل النماذج النشطة لمزوّد واحد أو كل نموذج نشط ضمن العرض. يُثرى كل نموذج على حدة — دون دمج — لتحصل على نتيجة نظيفة جنباً إلى جنب لكل نموذج. يُبثّ التقدّم مباشرةً، وتُقيَّم كل نتيجة ناجحة تلقائياً مقابل المرجع عند انتهاء التشغيل. إذا كان السيناريو يحمل مرفقات ثنائية، فعّل تخطّي النماذج التي لا يمكنها قراءة المرفقات فتُبلَّغ النماذج التي تفتقر إلى قدرة الملفات المطلوبة على أنها مُتخطّاة بدلاً من إنتاج إخفاقات مؤكدة.

3
قارن المُخرجات والتكلفة

يُحفَظ كل تشغيل مع مخرجاته المنظّمة، وحالة نجاحه، وأعداد الرموز، ووقت المعالجة، وإجمالي التكلفة المُحاسَب عليها. وسّع أي صف لفحص مخرجات JSON أو الانتقال إلى سجل الإثراء الأساسي.

4
أعد التشغيل للتحديث

إعادة تشغيل سيناريو على النموذج نفسه تكتب فوق نتيجته السابقة، فيعكس الجدول دائمًا آخر تشغيل. وإذا عدّلت إعدادات سيناريو، تُعلَّم النتائج الأقدم بأنها قديمة حتى تعيد تشغيلها. اضبط عدد التشغيلات لكل نموذج على 2 أو 3، فيُقاس كل نموذج مرجعيًا بهذا العدد من المرات — ويحتفظ الجدول بمتوسط التكلفة والجودة والسرعة إضافة إلى مدى الاتساق (فالنماذج تتفاوت من تشغيل لآخر)، بما يقارب ذلك المضاعف من الأرصدة. وكثيرًا ما يعود التفاوت الواسع إلى خصائص في المخطط تطرح أكثر من سؤال واحد لا إلى النموذج — وفحص الالتباس يكتشف تلك الخصائص ويصلحها.

قراءة النتائج

جدول النتائج مُصمّم للمقارنة. يبرز شريط ملخّص في الأعلى معدّل النجاح والأرخص والأسرع من النماذج التي نجحت. كل عمود — النموذج، الحالة، الاستراتيجية، التكلفة، الرموز، والوقت — قابل للفرز، فنقرة واحدة تُرتّب النماذج حسب السعر أو زمن الاستجابة. صفِّ حسب اسم النموذج أو الحالة أو الاستراتيجية لتضييق العرض، ووسّع أي صف لقراءة المخرجات المُهيكلة كاملة أو لفتح سجل الإثراء الأساسي.

إعادة النتائج إلى النظام: مصادر التقييم

الاختبار المرجعي أثمن من جدول تقرأه مرة واحدة. حدِّد سيناريو بوصفه مصدر تقييم فتبدأ نتائجه لكل نموذج في توجيه المنصة: تحمل النماذج درجاتك المقاسة كشارات في كل قائمة اختيار، وتُرتَّب القوائم بحسبها، ويؤدي الاختيار التلقائي للنموذج إلى النموذج الذي تصنّفه قياساتك أنت الأعلى لتلك المهمة. حدِّد عدة سيناريوهات فيُحسب متوسط الدرجات — فيصير معنى «أفضل نموذج» الأفضل على مخططاتك أنت، لا على لوحة صدارة عامة. ويمكن لمسؤولي النظام نشر سيناريو عام ليكون البديل الاحتياطي للمؤسسات التي ليس لديها سيناريو خاص بها.

أنت من يحدّد ما يزنه «الأفضل»: تمتزج الجودة والسرعة والتكلفة بنسبة تُضبط لكل نوع سيناريو ضمن الإعدادات → المؤسسة → الافتراضات (بمجموع 100، والثلث لكل منها افتراضيًا). ففريق يُحسّن لتكلفة الدفعات وفريق يُحسّن لجودة الإجابة سيختاران تلقائيًا — وعن حق — نماذج مختلفة من الاختبار المرجعي نفسه.

التكرار: إعادة المحاولة والتعطيل

قياس الأداء المرجعي عملية تكرارية. حدِّد الصفوف باستخدام مربعات الاختيار (اضغط مع زر Shift لتحديد نطاق)، ثم استخدم قائمة ··· للتصرف في مجموعة فرعية دون إعادة تشغيل كل شيء:

حدِّد مرجعًا ذهبيًا (مطلوب لإجراء الاختبار المرجعي)

يحمل كل سيناريو نتيجة مرجعية — أي المخرجات المتوقعة لكيانه — ولا يمكن قياس أداء السيناريو إلا بعد التحقق من هذه النتيجة المرجعية. وحتى ذلك الحين لن يظهر في أي قائمة تشغيل. والمرجع هو الأساس للحكم على الجودة: إلى أي مدى يقترب كل نموذج، حقلاً بحقل، و(بالنسبة للقوائم مثل طاقم فيلم) كم عدد العناصر الصحيحة التي عثر عليها فعلاً. أنت تحدّده — إلى جانب نموذج الحكم، ونموذج التضمين، وصرامة التقييم المستخدمة في التقدير مقابله — مباشرةً في محرّر السيناريو.

أنشئه بطريقتين. ولّده: أرفق مستندًا يحتوي على القيم الصحيحة (ورقة بيانات، صفحة رسمية)، وفعّل البحث على الويب، وشغّل بضعة نماذج قوية — فهي تستخرج الإجابة من مصدرك لا من الذاكرة، ليكون الناتج مستندًا إلى الحقيقة لا إلى التخمين. أو الصق نتيجة معروفة الصحة لديك بالفعل. في كلتا الحالتين تراجع الـ JSON، وتصحّح ما يلزم، وتضع عليه علامة مُتحقَّق منه — إقرار صريح بأن هذه هي الإجابة الذهبية.

بما أن المرجع مؤسَّس على وقائع وخضع لتحقق بشري مرة واحدة، فإنه يعمل أيضًا كمقياس موثوق تعيد استخدامه عبر كل نموذج وكل تشغيل مستقبلي.

أين تجده

توجد المعايير المرجعية في إدارة النماذج ← المعايير المرجعية (متاحة لمالكي المؤسسة والمشرفين). أنشئ السيناريوهات وأدرها هناك، أو ابدأ تشغيلاً من أي من أربعة مواضع: زر قياس أداء النماذج في شريط الأدوات (كل النماذج النشطة المعروضة)، أو إجراء قياس أداء النماذج على أي صف مزوّد (النماذج النشطة لذلك المزوّد)، أو قائمة المعيار المرجعي المنسدلة التي تظهر عند تحديد النماذج في لوحة النماذج (النماذج المحددة)، أو إجراء قياس أداء النموذج على أي صف نموذج مفرد.

يعمل زرّا تشغيل وتقييم النتائج في السيناريو بشكل تراكمي افتراضيًا — إذ يستهدفان فقط النماذج التي لا نتيجة لها بعد إضافةً إلى النتائج المتقادمة (والتقييمات غير المنجزة أو المتقادمة عند التقييم). ويتيح لك مربع التأكيد توسيع النطاق ليشمل كل نموذج نشط لإعادة تشغيل كاملة، أو تضييقه لاستبعاد العناصر المتقادمة. كما يمكن لمرشِّح النماذج المعروضة في جدول النتائج أن يعرض النماذج النشطة التي لم تخضع لقياس الأداء بعد.

التكلفة والفوترة

تُجري عمليات اختبار الأداء المرجعي استدعاءات LLM حقيقية وتخصم أرصدة بناءً على الاستخدام الفعلي، تمامًا كأي إثراء عادي. يخبرك مربع حوار التأكيد بعدد النماذج التي أنت على وشك تشغيلها قبل أن يُصرف أي رصيد. تعرض كل نتيجة محفوظة تكلفتها المُحتسبة، فيغدو اختبار الأداء المرجعي أيضًا أداة لمقارنة التكاليف.