تسجيل نقاط اختبار الأداء المرجعي

يحوّل التقييم الاختبار المرجعي من ”تفحّص JSON بالعين“ إلى رقم موضوعي. تُقيَّم نتيجة كل نموذج مقابل مرجع ذهبي — المخرج المتوقع — لينتج عن ذلك اكتمال وصحة ودرجة جودة إجمالية يمكنك الترتيب حسبها.

المرجع الذهبي

يحتاج التقييم إلى شيء يُقيَّم مقابله. يحمل كل سيناريو مخرجًا مرجعيًا: الإجابة الصحيحة لكيانه الثابت الوحيد. أنشئه بالتوليد باستخدام نماذج قوية (بحث ويب + مستند مصدر موثوق)، أو بلصق نتيجة معروفة الجودة، ثم تعديلها يدويًا — وضع عليها علامة مُتحقَّق منه بمجرد أن تثق بها. المرجع المُتحقَّق منه مطلوب لإجراء الاختبار المرجعي للسيناريو من الأساس، لذا يوجد دائمًا ما يُقيَّم مقابله. وإذا عدّلت المرجع لاحقًا — أو غيّرت إعداد تقييم السيناريو — فستُوسم النتائج الحالية بأنها قديمة حتى تعيد التقييم.

كما أن المرجع يحدّث نفسه. فالمرجع المُتحقَّق منه يظل مسودةً مصحَّحة يدويًا، والنماذج التي تُخضعها للمقارنة المرجعية هي مراجِعوه: فحيثما وجد الحَكَم إجابة نموذج مرشّح أفضل من إجابة المرجع (أو أن إجابة المرجع خاطئة)، وحيثما أثبتت عيّنات السيناريو نفسه خطأ المرجع، وحيثما ملأ نموذجٌ قيمةً تركها المرجع فارغة وأكّدها الحَكَم، تُسجّل النتيجة ملاحظة. وفي نهاية كل جولة تقييم تُدمج ملاحظات جميع النماذج المُقيَّمة — ما تثبته العيّنات أولًا، ثم الإجابة التي قدّمتها أغلبية النماذج — وتُكتب في المرجع. ولا يُستبدل تعديل أجرته جولة سابقة إلا بـدليل أقوى (العيّنات، أو حكم بأن القيمة خاطئة، أو مزيد من النماذج المتفقة — تُحتسب عبر الجولات)، ولا يُستبدل أبدًا برأي نموذج إضافي واحد، ولذلك فإن قياس النماذج واحدًا تلو الآخر لا يمكن أن ينحرف بالمرجع نحو آخر نموذج جرى تقييمه. وهذه التعديلات التلقائية لا تجعل الدرجات قديمة أبدًا (عمليات الحفظ التي تجريها بنفسك وحدها تفعل ذلك)، ويُسجَّل كل تعديل منها مع ما استبدله والنماذج التي أثارته.

راجِعها بأسلوب تعقّب التغييرات: يعرض مشهد المرجع في السيناريو، إلى جانب نتائجه، المرجعَ نفسه مع إبراز كل تعديل تلقائي في موضعه — القيمة السابقة مشطوبة، والقيمة الجديدة، وعدد النماذج التي تدعمها، والسبب. كل شيء مقبول ما لم ترفضه؛ والرفض يعيد القيمة السابقة ويُبقي ذلك المسار خارج الجولات المستقبلية. رشّح حسب السمة أو الدليل (التعديلات المستندة إلى نموذج واحد هي الجديرة بالنظر)، وحدّد ما هو معروض، وارفض دفعةً واحدة.

كيف تُقارَن القيم

المشكلة الأساسية: يمكن كتابة إجابتين صحيحتين بطريقتين مختلفتين. فالنموذج الذي يسمّي ممثلاً ”R. Downey Jr.“ بدلاً من ”Robert Downey Jr.“ ليس مخطئًا. لذا تُقارن كل حقل بسلّم متدرّج — الأرخص والأكثر يقينًا أولاً، مع التصعيد عند الحاجة فقط:

1
مطابقة تامة ومُطبَّعة

القيم المتطابقة تتوافق. وكذلك القيم التي تختلف فقط في حالة الأحرف أو المسافات المحيطة أو الدقة الرقمية ("Acme" = "ACME"، 4.0 = 4). مجانية وحتمية تمامًا.

2
تشابه التضمين

بالنسبة إلى النص، يُدمَج المرشّح والمرجع ويُقارَنان بتشابه جيب التمام. فوق العتبة يُعدّان متطابقين — لذا فإن تهجئة بديلة صالحة مثل "R. Downey Jr." مقابل "Robert Downey Jr." تُعدّ تطابقاً لا خطأ. أما التواريخ فهي الاستثناء: تُقارَن بوصفها قيماً تقويمية، لا بالتشابه أبداً، بحيث يكون التاريخ القريب لكن الخاطئ ("1972-03-14" مقابل "1972-03-24") عدم تطابق واضح بدلاً من جيب تمام مرتفع خادع. والقيم المنطقية كذلك إما مطابقة تماماً أو لا شيء.

3
حَكَم LLM

القيم التي يتعذّر الحسم فيها بالتشابه — جميع حقول النص الحر مثل الملخّصات والأوصاف، وكل رقم غير مطابق تمامًا، وأي قيمة مختلفة بوضوح تدعمها مستنداتك أو معظم النماذج الأخرى — تُرسَل إلى نموذج حَكَم. والحَكَم مُعمّى: يرى القيمتين باسم A وB، مع موضع الحقل في المخطط (آباؤه وأوصافهم، ونوعه، وعنصر القائمة الذي ينتمي إليه) ومستنداتك المصدرية إن وُجدت في السيناريو، ثم يبيّن أيّهما يخدم الحقل بشكل أفضل، أو أن كلتيهما صحيحة، أو أن إحداهما خاطئة. والقيمة المرشّحة التي يُحكم بأنها مكافئة للمرجع أو أفضل منه — أو المرجع الذي يُحكم بخطئه — تنال الدرجة كاملة؛ أما الإجابة الأضعف فتنال درجة جزئية، والخاطئة تنال القليل أو لا شيء. ويحصل الرقم على درجة جزئية حين يحتمل الحقل ذلك (كتلة جزيئية 273.37 مقابل 273.35، أو عمر نصف 12 مقابل 15)، ويسقط حيث تهمّ الدقة التامة (سنة إصدار 2020 مقابل 2023). أما القيمة التي تركها المرجع فارغة فيُسأل عنها على حدة: فإن تأكّدت صحتها، احتُسبت قيمة كان ينبغي أن يتضمّنها المرجع وعثر عليها النموذج — فترتفع النتيجة، لا أن يُكتفى بعدم المعاقبة — ويعتمدها المرجع.

يتحكم إعداد الصرامة في عتبة التضمين: فالقيمة الأعلى تعني أن على قيمتين مكتوبتين بشكل مختلف أن تكونا أكثر تشابهًا لتُعدّا متطابقتين. تُضبط الصرامة، ونموذج الحَكَم الاختياري، ونموذج التضمين جميعها على السيناريو — لا يُختار ذلك في كل مرة تُقيّم فيها — بحيث يُقيَّم كل نموذج بالطريقة نفسها وتبقى الدرجات قابلة للمقارنة.

تقييم المصفوفات (قوائم العناصر)

القوائم — طاقم عمل فيلم، أو الآثار الجانبية لدواء — هي المكان الذي تختلف فيه النماذج أكثر ما يكون: فقد يجد نموذج صغير 4 ممثلين بينما يجد نموذج قوي 15. الترتيب لا يهم، ويجب أن يفوز إيجاد عددٍ أكبر من العناصر الصحيحة. لذا تُقيَّم المصفوفات بوصفها مجموعة، وليس موضعًا بموضع:

وسّع صفّ نتيجة لترى بدقة العناصر التي تمت مطابقتها أو فُقدت أو كانت هلوسة.

قراءة الدرجة

الرقم الواحد يخفي الكثير، لذا تحمل كل نتيجة درجات فرعية:

يعرض الصف القابل للتوسيع التفصيل على مستوى كل حقل: المرشّح مقابل المرجع، وأيّ درجة من السلّم حسمت النتيجة، ودرجة التشابه حيثما كان ذلك مناسبًا.

  1. 1الدرجات الفرعية الأربع الكامنة خلف الرقم الواحد
  2. 2أي درجة في السلّم حسمت هذا الحقل
  3. 3القيمة المرشَّحة مقابل المرجع
يوضّح كل حقل الدرجة التي حسمته: exact لا يكلّف شيئًا، وembedding يقيس التشابه، وjudge يستهلك استدعاء نموذج، وmiss هو حقل موجود في المرجع وغير موجود في المرشّح.

الجودة ليست إلا ثلث الحكاية. فحين يُغذّي المعيار المرجعي اختيار النموذج — بوصفه مصدر تسجيل نقاط — تأتي مرتبة النموذج من مزج الجودة والسرعة والتكلفة، والنسبة بينها قرارك أنت: اضبطها لكل نوع سيناريو من الإعدادات ← المؤسسة ← الافتراضات، بحيث يبلغ مجموع كلٍّ منها 100 وتُقسَّم بالتساوي افتراضيًا. رجّح التكلفة بقوة يتفوّق نموذج رخيص لا بأس به على نموذج ممتاز باهظ — وهو الجواب الصحيح لبعض أعباء العمل والخاطئ لغيرها، ولذلك تمتنع المنصة عن تقريره نيابةً عنك. وتُقرأ السرعة والتكلفة بالقياس إلى نتائج السيناريو الأخرى على مقياس لوغاريتمي: النموذج الأسرع أو الأرخص ينال 100، ومن هو أبطأ أو أغلى بعشرة أضعاف ينال 0، لكن المجال الضيق لا يُمَطّ أبدًا ليملأ النطاق — نموذجان بتكلفة 10 و12 دولارًا يحصلان على 100 و92، لا على 100 و0.

عندما يُشغّل السيناريو نموذجًا أكثر من مرة (تكرارات)، تُقيَّم كل عملية تشغيل على حدة ويعرض الصف متوسط الجودة بالإضافة إلى نطاق الاتساق (أدنى–أعلى قيم عمليات التشغيل) — بحيث يسهل رصد النموذج الصحيح في المتوسط لكنه متذبذب. والمُخرَج المرئي هو عملية التشغيل ذات الجودة الوسيطة.

تقييم الاختبارات المرجعية للتوليد

لا تقتصر قياسات الأداء على الإثراء: يمكن للسيناريو أيضًا اختبار توليد العيّنات (يبتكر كل نموذج JSON نموذجيًا للطلب النصي الحر نفسه) أو توليد المخططات (يحوّل كل نموذج عيّنة ثابتة إلى مخطط). ولكلٍّ منهما قواعد تقييم خاصة:

في كلتا الحالتين تحتفظ الأعمدة المألوفة بمعناها — مرّر المؤشّر فوق رأس العمود للحصول على التعريف الخاص بالنوع، ووسّع صفًا لعرض التفصيل الكامل.

التكلفة وما يتم تشغيله

التقييم تمريرة منفصلة على نتائج محفوظة مسبقًا — فهو لا يعيد الإثراء أبدًا، ومن ثَمّ لا يدفع مجددًا مقابل النماذج قيد الاختبار. لكنه يضمّن النصوص لمقارنة القيم (ويشغّل الحَكَم إن كان للسيناريو حَكَم)، وهو ما يخصم أرصدة بحسب الاستخدام. ويحدث ذلك تلقائيًا في كل تشغيل — إذ يُقيَّم كل نموذج فور انتهاء تشغيلاته — ومرة أخرى كلما أعدت التقييم. وإذا لم يكن لدى مؤسستك نموذج تضمين مُهيّأ (ولم يحدّد السيناريو بديلًا)، فسيظل التقييم يعمل لكنه يرجع إلى المطابقة التامة فقط (فتُحتسب صيغ الكتابة البديلة عدم تطابق)، وينبّهك إلى ذلك. أما تعطّل الحَكَم فأمر مختلف: إذا فشل استدعاء الحَكَم، يتوقف التقييم برسالة خطأ صريحة ولا يحتفظ النموذج المتأثر بأي درجات جزئية — فالنتيجة إما مُقيَّمة بالكامل أو غير مُقيَّمة إطلاقًا، وتبقى قابلة لإعادة التقييم لاحقًا. وتُخزَّن إجابات الحَكَم مؤقتًا لكل سيناريو بحسب محتواها: فالسؤال نفسه إذا أثاره نموذج آخر أو تكرّر أو ورد في تمريرة أخرى لا يُدفع ثمنه مرتين، وإعادة التقييم بعد تحديث المرجع لنفسه لا تعيد طرح سوى الأسئلة المتعلقة بالحقول المعدَّلة. لا شيء يفعله المُقيِّم مخفيٌّ: كل جولة تقييم لنموذج تترك سجل تقييم في المحفوظات — صفٌّ لكل استدعاء مُقيِّم مع موجّهه وإجابته ورموزه وتكلفته، بما في ذلك الاستدعاءات الفاشلة، إضافة إلى عدد الأسئلة التي أجابت عنها الذاكرة مجانًا — ويعرض جدول النتائج تكلفة المُقيِّم وعدد الاستدعاءات ووقت التقييم لكل نموذج إلى جانب رابط إليه. عند اختيار الحَكَم، لاحظ أن حُكّام الـ LLM قد يحابون عائلة نموذجهم الخاصة — يُفضَّل اختيار حَكَم من مزوّد لا تُجري عليه قياس الأداء.

أين تجده

في إدارة النماذج → المعايير المرجعية، حدِّد مرجعًا وتحقّق منه في محرّر السيناريو (واختر هناك نموذج الحَكَم ونموذج التضمين ودرجة الصرامة). ومنذ ذلك الحين، يقيّم كل تشغيل تلقائيًا نتائجه الناجحة — إذ يُملأ عمود الجودة القابل للفرز دون أي خطوة إضافية. استخدم إعادة تقييم النتائج (زر الترويسة أو قائمة ···) لإعادة التقدير بعد تعديل المرجع أو إعدادات التقييم. وتفتح شارة تحديثات المرجع بجوار حالة المرجع سجلَّ ما غيّرته تمريرات التقييم، مع إمكانية التراجع عن كل إدخال.