دمج متعدد النماذج - وثائق Entity Enricher

دمج متعدد النماذج

عند تشغيل الإثراء نفسه عبر نماذج ذكاء اصطناعي متعددة، يمكن لـ Entity Enricher دمج النتائج في مخرجات واحدة عالية الثقة. يكتشف الدمج التعارضات بين مخرجات النماذج ويحلّها باستخدام قواعد حتمية أو تحكيم مدعوم بالـ LLM.

مسار الدمج

مخرجات النموذج
نتيجة Claude
نتيجة GPT-4
نتيجة Gemini
اكتشاف التعارضات
قارن كل حقل
عبر جميع النماذج
الحل
دمج قائم على القواعد
أو
تحكيم LLM
النتيجة المدموجة
مخرجات واحدة مع
مسار تدقيق التعارضات

الخطوة 1: اكتشاف التعارضات

يقارن كاشف التعارضات كل حقل عبر جميع مخرجات النماذج. تمر الحقول التي تتفق عليها جميع النماذج دون تغيير. أما الحقول التي تختلف عليها النماذج فتُعلَّم كتعارضات تحتاج إلى حل.

قواعد المقارنة حسب نوع الحقل
النوعطريقة المقارنةمعنى التوافق
قيمة مفردةتطابق تام مُطبَّع (مُشذَّب، بأحرف صغيرة، مُقرَّب)جميع القيم متساوية بعد التسوية
متعدد اللغاتتحدّد اللغة الأساسية للتشغيل النتيجة؛ واختلافات الترجمة تُطلق دمجًا لكل لغة فقطالنص نفسه في اللغة الأساسية — اختلافات صياغة الترجمة ليست تعارضات
مصفوفةمقارنة المجموعات (غير مرتبطة بالترتيب) على عرض العناصر باللغة الأساسيةالعناصر نفسها بغضّ النظر عن الترتيب أو صياغة الترجمة
كائنلكل خاصية طالما أثبتت حقول الهوية أن النموذجين يصفان الشيء نفسه — وإلا فالكائن بأكمله تعارض واحدتتطابق جميع الخصائص المتداخلة
فارغة (null) / خاليةالقيمة الفارغة (null) أو السلسلة الفارغة أو المصفوفة الفارغة تُعدّ امتناعًا لا ادعاءًتفوز القيمة المملوءة دون احتساب تعارض
مثال: إثراء «Sanofi» بنموذجين
مخرجات Claude
revenue: 42.2
gmp_status: true
description: “Sanofi is a global...”
مخرجات GPT-4
revenue: 44.1
gmp_status: true
description: “Sanofi SA is a...”
النتيجة: gmp_status = agreed | revenue = conflict (42.2 مقابل 44.1) | description = conflict (نص مختلف)

الخطوة 2: حل التعارضات

تُحلّ التعارضات باستخدام إحدى طريقتين، تبعًا لما إذا كنت قد اخترت نموذج تحكيم في الشريط الجانبي.

الخيار أ

دمج قائم على القواعد

تُطبَّق قواعد حتمية بحسب نوع بيانات كل حقل. وفي الغالبية العظمى من الحالات لا يستلزم ذلك أي استدعاء لـ LLM إطلاقًا — فالحسم فوري ومجاني. والاستثناء الوحيد هو الأرقام التي تختلف النماذج حولها اختلافًا كبيرًا، وهي ما لا تستطيع أي قاعدة حسمه بأمانة؛ انظر أدناه.

نوع الحقلقاعدةالمبرّر
سلسلة نصيةتصويت الأغلبية؛ وعند التعادل تُختار أطول قيمةعادةً ما يكون المزيد من التفاصيل أفضل
عددقيمة النموذج الأقرب إلى الوسيطمقاوم للقيم الشاذة، ولا ينتج متوسطًا مصطنعًا أبدًا
قيمة منطقيةالأغلبية؛ وعند التعادل تفوز القيمة trueافتراضي متحفّظ
متعدد اللغاتتصويت الأغلبية لكل لغة، واتحاد اللغاتتُحسم كل لغة على نحو مستقل
مصفوفةاتحاد مراعٍ للمفاتيح: تتجمّع العناصر حسب حقول مفاتيحها، وتندمج التهجئات المختلفة معًا، وتُدمج العناصر المتطابقة حقلًا بحقلصفّ واحد لكل كيان منطقي، دون فقدان أي شيء
كائنلكل حقل عندما تتطابق الهوية؛ وإلا فيُؤخذ كائن أحد النماذج كاملاًمزج كائنين يصفان كيانين مختلفين يخترع كائنًا ثالثًا لم يُعِده أي من النموذجين
فارغة مقابل ذات قيمةتفضيل القيمة المملوءةالبيانات المفقودة أسوأ من أي قيمة

كاسر التعادل: عند تعادل الأصوات، تفوز القيمة الآتية من النموذج الأعلى سعرًا (كمؤشر على القدرة)، يليه الترتيب الأبجدي لاسم النموذج. أما في الكائن المأخوذ ككتلة واحدة، فيتوسّط المعيارَين اكتمالُ البيانات — أي عدد الأوراق المملوءة: فما دام لا شيء يُثبت أيّ الكيانين حقيقي، يُفضَّل النموذج الأقوى، ثم الإجابة التي تحمل معلومات أكثر.

تُدمج الكائنات المتداخلة ككلّ، لا بالمزج

لا يكون دمج كائن متداخل حقلًا بحقل آمنًا إلا ما دام النموذجان يصفان الشيء نفسه. وحين لا تُثبت حقول الهوية ذلك — مفاتيح مختلفة، أو غياب المفاتيح تمامًا مع اختلاف حقيقي تحتها — يصبح الكائن تعارضًا واحدًا وتُؤخذ نسخة أحد النموذجين حرفيًا. وإلا لركّب الدمج كائنًا هجينًا: عنوان هذا النموذج على شركة ذاك النموذج. وثمة نتيجة مقصودة يجدر معرفتها: يُؤخذ الفائز بما فيه من فراغات، فالحقل الذي تركه الفائز فارغًا يبقى فارغًا — وهو ما قد يحول دون قبول الكيان عند بوابة الدخول إلى قاعدة البيانات. ويُذكر السبب ضمن تحذيرات التحقق الخاصة بالتشغيل.

عندما تتباعد الأرقام أكثر من أن تُدمج

«الأقرب إلى الوسيط» قاعدة صائبة حين تختلف النماذج في التقريب، وخاطئة حين تتناقض فيما بينها — فالفارق بين 0 و1854 ليس فارق تقريب. وعندما يبلغ التشتّت النسبي للقيم 20%، يُصعَّد ذلك الحقل إلى مُحكِّم LLM يُختار تلقائيًا وفق آلية اختيار النماذج المعتادة في مؤسستك، وتُفوتَر المكالمة كأي مكالمة أخرى. وتُعلَّم تلك الحقول بوسم «تصعيد تلقائي» في سجل تدقيق الدمج، حتى يوضّح كل دمج استهلك رموزًا أيّ الحقول تسبّبت فيه.

الخيار ب

تحكيم LLM

عند اختيار نموذج تحكيم في الشريط الجانبي، تُرسَل التعارضات إلى LLM لحلّها بذكاء. يتلقى المُحكِّم سياق الكينونة، وأوصاف حقول المخطط، وجميع القيم المتعارضة، ثم يتخذ قرارات مُعلَّلة.

ما الذي يُرجعه المُحكِّم
القيمة المختارةالقيمة التي يعتبرها الأكثر دقة
النموذج المصدرمن أي نموذج جاءت القيمة المختارة
الاستدلاللماذا اختار تلك القيمة دون البدائل
الثقةمدى ثقته في القرار (عالية، متوسطة، منخفضة)

الحل البديل: إذا فشل نموذج التحكيم (انتهاء المهلة أو خطأ)، يعود النظام تلقائيًا إلى الدمج القائم على القواعد لتحصل دائمًا على نتيجة.

الخطوة 3: النتيجة المدموجة

بعد حل التعارضات، يبني النظام نتيجة مدمجة واحدة ويخزّنها بوصفها سجل “تحكيم” في قاعدة البيانات. تتضمن كل نتيجة مدمجة سجل تدقيق يتيح لك تتبّع كيفية حل كل تعارض.

سجل التدقيق (بيانات التحكيم الوصفية)

تتضمن كل نتيجة مدمجة بيانات وصفية توثّق عملية الدمج:

“method”: “rule_based” | “llm”
“source_record_ids”: [“uuid-1”, “uuid-2”]
“total_fields”: 23
“agreed_fields”: 18
“conflicted_fields”: 5
“decisions”: [{ path, chosen_value, rule_used, ... }]

يظهر سجلّ التدقيق نفسه لأي سجلّ مدمج في صفحة التاريخ، ضمن علامة تبويب النظرة العامة. يسرد السجلّ المدمج النماذج التي دمجها بدلًا من نموذج خاص به — وعندما يكون الدمج قائمًا على القواعد فإنه لا يجري أي استدعاء لـ LLM على الإطلاق، لذا لا يحمل أي موجّه ولا رموزًا ولا تكلفة.

ما تراه في الواجهة

بعد اكتمال الدمج، يعرض تبويب “المدمج” في لوحة النتائج ما يلي:

1
رأس الملخّص
يعرض طريقة الحل (قائمة على القواعد أو LLM)، وعددًا مثل ”18 متفق عليها / 5 محلولة / 23 حقلًا إجماليًا“.
2
JSON مدموج
الإخراج المنظم الكامل الذي يجمع القيم المتفق عليها والتعارضات المحلولة في مستند JSON واحد.
3
تقرير التعارضات
بطاقات قابلة للتوسيع لكل تعارض تعرض: مسار الحقل، وشارة طريقة الحل (تصويت الأغلبية، الوسيط، الاتحاد، إلخ)، وجميع قيم النماذج مع تمييز القيمة المختارة، ونص التبرير في حال استُخدم تحكيم LLM.

الدمج التلقائي في معالجة الدُّفعات

في الإثراء بالدفعات، يحدث الدمج تلقائيًا عند اختيارك نموذجين أو أكثر. ولا حاجة إلى النقر على "دمج النتائج" يدويًا — فبمجرد نجاح كل نموذج بالنسبة لكيان ما، يُنفَّذ الدمج وتظهر النتيجة المدمجة إلى جانب مخرجات النماذج الفردية. أما التشغيل الذي فشل فيه أحد النماذج فلا يُدمج عن قصد: فدمج ما تبقّى ينشر بصمت إجابة جزئية كما لو كانت الإجابة المتّفق عليها. استعِد النموذج المفقود أولًا — فإعادة محاولة مجالات خبرته الفاشلة تدمج التشغيل تلقائيًا بمجرد اكتماله من جديد.

الدمج المتدفّق: أثناء الإثراء الفردي والدُّفعي معًا، يُبَثّ تقدّم الدمج عبر أحداث الخادم المُرسَلة (Server-Sent Events). ترى أحداث fusion_started وconflicts_detected وfusion_completed في الوقت الفعلي.

التحكيم القائم على القواعد مقابل تحكيم LLM: متى تستخدم كلًّا منهما

قائم على القواعد (فوري، ومجاني في معظم الأحوال)
  • بيانات واقعية/رقمية في الغالب حيث يعمل منطق التصويت جيدًا
  • المعالجة عالية الحجم أو معالجة الدُفعات حيث تكون التكلفة مهمة
  • مخططات بسيطة ذات تعارضات متوقعة قليلة
  • عندما تريد نتائج حتمية وقابلة للتكرار
تحكيم LLM (تكلفة إضافية)
  • المخططات المعقدة التي يكون فيها السياق مهمًا لحلّها
  • بيانات نصية (أوصاف، ملخصات) حيث يكون التصويت غير كافٍ
  • عندما تحتاج إلى قرارات قابلة للتفسير مصحوبة بمنطق التعليل
  • عمليات الإثراء عالية الأهمية حيث تستحق الدقة التكلفة الإضافية