يحوّل التقييم الاختبار المرجعي من ”تفحّص JSON بالعين“ إلى رقم موضوعي. تُقيَّم نتيجة كل نموذج مقابل مرجع ذهبي — المخرج المتوقع — لينتج عن ذلك اكتمال وصحة ودرجة جودة إجمالية يمكنك الترتيب حسبها.
يحتاج التقييم إلى شيء يُقيَّم مقابله. يحمل كل سيناريو مخرجًا مرجعيًا: الإجابة الصحيحة لكيانه الثابت الوحيد. أنشئه بالتوليد باستخدام نماذج قوية (بحث ويب + مستند مصدر موثوق)، أو بلصق نتيجة معروفة الجودة، ثم تعديلها يدويًا — وضع عليها علامة مُتحقَّق منه بمجرد أن تثق بها. المرجع المُتحقَّق منه مطلوب لإجراء الاختبار المرجعي للسيناريو من الأساس، لذا يوجد دائمًا ما يُقيَّم مقابله. وإذا عدّلت المرجع لاحقًا — أو غيّرت إعداد تقييم السيناريو — فستُوسم النتائج الحالية بأنها قديمة حتى تعيد التقييم.
المشكلة الأساسية: يمكن كتابة إجابتين صحيحتين بطريقتين مختلفتين. فالنموذج الذي يسمّي ممثلاً ”R. Downey Jr.“ بدلاً من ”Robert Downey Jr.“ ليس مخطئًا. لذا تُقارن كل حقل بسلّم متدرّج — الأرخص والأكثر يقينًا أولاً، مع التصعيد عند الحاجة فقط:
القيم المتطابقة تتوافق. وكذلك القيم التي تختلف فقط في حالة الأحرف أو المسافات المحيطة أو الدقة الرقمية ("Acme" = "ACME"، 4.0 = 4). مجانية وحتمية تمامًا.
بالنسبة إلى النص، يُدمَج المرشّح والمرجع ويُقارَنان بتشابه جيب التمام. فوق العتبة يُعدّان متطابقين — لذا فإن تهجئة بديلة صالحة مثل "R. Downey Jr." مقابل "Robert Downey Jr." تُعدّ تطابقاً لا خطأ. أما التواريخ فهي الاستثناء: تُقارَن بوصفها قيماً تقويمية، لا بالتشابه أبداً، بحيث يكون التاريخ القريب لكن الخاطئ ("1972-03-14" مقابل "1972-03-24") عدم تطابق واضح بدلاً من جيب تمام مرتفع خادع. والقيم المنطقية كذلك إما مطابقة تماماً أو لا شيء.
القيم التي يتعذّر الحسم فيها بالتشابه — جميع حقول النص الحر مثل الملخصات والأوصاف، وكل رقم غير مطابق — تُرسَل إلى نموذج حَكَم، يمنح درجة من 0 إلى 100 لمدى جودة التقاط الإجابة لمعنى المرجع. يكافئ الإجابة الصحيحة المصاغة بشكل مختلف أو أكثر إيجازاً، ويمنح الرقم درجة جزئية عندما يسمح الحقل بذلك (وزن جزيئي 273.37 مقابل 273.35، ونصف عمر 12 مقابل 15) بينما يُرسّبه حيث تكون الدقة مهمة (سنة إصدار 2020 مقابل 2023). بدون حَكَم، يعود النص الحر إلى درجة تشابه متصلة، ويكون الرقم غير المطابق مجرد عدم تطابق.
يتحكم إعداد الصرامة في عتبة التضمين: فالقيمة الأعلى تعني أن على قيمتين مكتوبتين بشكل مختلف أن تكونا أكثر تشابهًا لتُعدّا متطابقتين. تُضبط الصرامة، ونموذج الحَكَم الاختياري، ونموذج التضمين جميعها على السيناريو — لا يُختار ذلك في كل مرة تُقيّم فيها — بحيث يُقيَّم كل نموذج بالطريقة نفسها وتبقى الدرجات قابلة للمقارنة.
القوائم — طاقم عمل فيلم، أو الآثار الجانبية لدواء — هي المكان الذي تختلف فيه النماذج أكثر ما يكون: فقد يجد نموذج صغير 4 ممثلين بينما يجد نموذج قوي 15. الترتيب لا يهم، ويجب أن يفوز إيجاد عددٍ أكبر من العناصر الصحيحة. لذا تُقيَّم المصفوفات بوصفها مجموعة، وليس موضعًا بموضع:
وسّع صفّ نتيجة لترى بدقة العناصر التي تمت مطابقتها أو فُقدت أو كانت هلوسة.
الرقم الواحد يخفي الكثير، لذا تحمل كل نتيجة درجات فرعية:
يعرض الصف القابل للتوسيع التفصيل على مستوى كل حقل: المرشّح مقابل المرجع، وأيّ درجة من السلّم حسمت النتيجة، ودرجة التشابه حيثما كان ذلك مناسبًا.
الجودة ثلث الحكاية فقط. فحين يغذّي معيار قياس اختيارَ النموذج — بوصفه مصدر تقييم — تنشأ مرتبة النموذج من مزج الجودة والسرعة والتكلفة، وهذه النسبة قرارك أنت: اضبطها لكل نوع سيناريو من الإعدادات ← المؤسسة ← الإعدادات الافتراضية، بحيث يبلغ مجموع كلٍّ منها 100، وتُقسَّم بالتساوي افتراضيًا. أعطِ التكلفة وزنًا كبيرًا يتفوّق نموذج رخيص ومقبول على آخر ممتاز وباهظ — وهو الجواب الصحيح لبعض أحمال العمل والخاطئ لغيرها، لذا تمتنع المنصة عن حسم ذلك نيابةً عنك.
عندما يُشغّل السيناريو نموذجًا أكثر من مرة (تكرارات)، تُقيَّم كل عملية تشغيل على حدة ويعرض الصف متوسط الجودة بالإضافة إلى نطاق الاتساق (أدنى–أعلى قيم عمليات التشغيل) — بحيث يسهل رصد النموذج الصحيح في المتوسط لكنه متذبذب. والمُخرَج المرئي هو عملية التشغيل ذات الجودة الوسيطة.
لا يقتصر قياس الأداء على الإثراء: يمكن للسيناريو أيضًا اختبار توليد العينة (يختلق كل نموذج مثال JSON لنوع كيان) أو توليد المخطط (يحوّل كل نموذج عينة ثابتة إلى مخطط). ولكلٍّ قواعد تقييمه الخاصة:
في كلتا الحالتين تحتفظ الأعمدة المألوفة بمعناها — مرّر المؤشّر فوق رأس العمود للحصول على التعريف الخاص بالنوع، ووسّع صفًا لعرض التفصيل الكامل.
التقييم عملية منفصلة تُجرى على النتائج المحفوظة مسبقًا — فهو لا يُعيد الإثراء أبدًا، وبالتالي لا يُعيد الدفع مقابل النماذج قيد الاختبار. لكنه يُضمّن النص لمقارنة القيم (ويُشغّل الحَكَم، إن كان لدى السيناريو واحد)، وهو ما يخصم أرصدة بناءً على الاستخدام. يحدث هذا تلقائيًا خلال كل تشغيل — إذ يُقيَّم كل نموذج فور انتهاء عمليات تشغيله — ومجددًا في كل مرة تُعيد فيها التقييم. إذا لم يكن لدى مؤسستك نموذج تضمين مُهيّأ (ولم يُحدّد السيناريو تجاوزًا)، فإن التقييم يستمر مع الرجوع إلى المطابقة التامة فقط (فتُحتسب التهجئات البديلة عندئذٍ عدم تطابق)، ويُنبّه بذلك. أما تعطّل الحَكَم فأمر مختلف: إذا فشل استدعاء الحَكَم، يتوقف التقييم بخطأ صريح ولا يحتفظ النموذج المتأثر بأي درجات جزئية — فالنتيجة إما مُقيَّمة بالكامل أو غير مُقيَّمة إطلاقًا، وتبقى قابلة لإعادة التقييم لاحقًا. عند اختيار الحَكَم، لاحظ أن حُكّام الـ LLM قد يحابون عائلة نموذجهم الخاصة — يُفضَّل اختيار حَكَم من مزوّد لا تُجري عليه قياس الأداء.
في إدارة النماذج ← المعايير المرجعية، اضبط مرجعًا وتحقق منه في محرر السيناريوهات (واختر هناك نموذج التحكيم، ونموذج التضمين، ومستوى الصرامة). من ذلك الحين، يقيّم كل تشغيل تلقائيًا نتائجه الناجحة — إذ يُملأ عمود الجودة القابل للفرز دون أي خطوة إضافية. استخدم إعادة تقييم النتائج (زر الترويسة أو قائمة ···) لإعادة التقييم بعد تعديل المرجع أو إعدادات التقييم.