وحدة المقارنة هي إعداد كامل

يتأثر السلوك بالنموذج وتعليماته والأدوات المتاحة والمصدر المسترجع وإعدادات الاستدلال. لذلك نقارن تكوينًا محددًا على حالات مشتركة، بدل نسبة النتيجة إلى الاسم وحده. تغيير أحد هذه العناصر قد يغيّر معنى المقارنة حتى لو بقي اسم النموذج كما هو.

المدرس يحتاج شرحًا وتوقيت مساعدة مناسبين، والممتحن يحتاج الالتزام بالمهمة، والمصحح يحتاج احترام معيار الحكم. لا نجمع هذه المسؤوليات في ترتيب واحد ثم نفترض أن الأعلى هو الأفضل للجميع. وكذلك لا تجعل تفضيلات الطالب في الحوار معيار التصحيح تابعًا لاختياره.

الصحة والجودة تحتاجان أدوات مختلفة

هناك نتائج يمكن فحصها بقواعد حتمية: حكم موضوعي، بنية نتيجة أداة، أو الحفاظ على سياق المصدر. أما ملاءمة التلميح ووضوح الشرح فتحتاج معايير ومراجعة تربوية. الفصل بينهما يمنع أن يغطي أسلوب جميل خطأ في الإجابة.

توثق Microsoft مكتبات تقييم في .NET لمقاييس الجودة ومقيمين مخصصين وتخزين النتائج والتقارير. أدوات القياس تساعد على تنظيم المقارنة، بينما تعريف النجاح يبقى مسؤولية التصميم. الوثائق الرسمية.

حالات من واقع المهمة

رؤيتنا لحالات التقييم تشمل سؤالًا عربيًا يحتمل لبسًا، ومحاولة رياضية بطريقة بديلة، ومصدرًا لا يدعم الادعاء، وطلبًا يحتاج تلميحًا محدودًا. السؤال هو هل اتخذ النظام الإجراء المناسب، لا هل كرر نص إجابة مرجعية حرفيًا.

الحوار متعدد الأدوار مهم أيضًا: ما الذي يتغير بعد توضيح الطالب؟ هل تُستدعى الأداة المناسبة بمعطيات صحيحة؟ وهل يبقى ما جاء من المصدر متسقًا في الشرح؟ وفي الصوت، نضيف ما سمعه الطالب واتساق النطق مع الصيغة، دون اختزال الجودة في دقة تفريغ الكلام.

القاضي الآلي نفسه يحتاج مراجعة

يمكن لنموذج مقيم أن يساعد في فحص شرح مفتوح، لكنه قد يفضّل أسلوبًا أو يخطئ في الحكم. لذلك نربط استخدامه بمراجعة خبراء وحالات مرجعية، ونسمح بعدم كفاية الدليل. توصي Anthropic بمعايرة المقيمين بالنماذج مع البشر واستخدام المقيمين الحتميين حيث يناسبون. الإرشاد الأصلي.

ننظر أيضًا إلى تكرار الحالات واتجاه النتائج عبر سيناريوهات متعددة، بدل تحويل تشغيل عشوائي واحد إلى حقيقة ثابتة عن الجودة. والمراجعة تشمل مواضع الاختلاف بين المقيمين، لأن رقمًا بلا فهم لمصدره قد يخفي خللًا في أداة القياس نفسها.

مقارنة عادلة وحالات تكشف الحدود

المقارنة المفيدة تثبت المهمة والمصدر والأدوات قدر الإمكان، وتسجل ما تغيّر في الإعداد. وتفصل حالات بناء التعليمات عن حالات المراجعة المستقلة، حتى لا يبدو حفظ المثال نجاحًا في مهمة جديدة. كما تحتاج إلى فحص شرائح مثل نوع السؤال والمعرفة السابقة واللغة، لا متوسط عام وحده.

وعند ظهور اختلاف، نسأل أين بدأ: فهم السؤال، استرجاع المصدر، اختيار الأداة، أم صياغة التفسير؟ هذا يحوّل التقييم إلى وسيلة لتحسين التصميم بدل سباق درجات. يمكن أن ينجح نموذج في شرح مباشر ويحتاج إعدادًا مختلفًا لحوار تلميحات؛ المهم أن يكون قرار استخدامه مرتبطًا بالمهمة والدليل الذي يقيسها.

من سلوك النظام إلى تعلّم الطالب

الشرح الصحيح والمنضبط شرط مهم، لكنه لا يثبت أثرًا تعليميًا. لهذا نفصل في رؤيتنا بين تقييم المخرجات وتقييم ما يستطيع الطالب فعله: محاولة دون مساعدة، سؤال جديد عن الفكرة، أو احتفاظ بالفهم بعد وقت. هذه أسئلة تتطلب دراسة استخدام وتعليم، لا قاضيًا لغويًا فقط.

نوازن وقت الانتظار واستهلاك الموارد ضمن إعداد يحقق معايير المهمة، دون نشر أرقام أو نتائج غير مثبتة. اقرأ رؤية تقييم المنصة والصوت والتفكير الرياضي. اختيار AI في وردة جزء من تصميم تعليم يمكن مساءلته، وليس اختيار اسم مشهور.

المصادر والسياق

  1. Microsoft Learn — Microsoft.Extensions.AI.Evaluation libraries

    وثائق أدوات قياس الجودة والحفظ والتقارير في .NET؛ اختيار المقاييس مسؤولية تصميم التقييم.

  2. Anthropic — Demystifying evals for AI agents

    إرشاد هندسي يميز المقيمين بالكود والنماذج والبشر؛ ليس اختبارًا لوردة.

توضح المصادر هنا الأدلة أو المواصفات أو سلوك المنتجات بحسب نوعها؛ لا يعني الاستشهاد بها أنها اختبرت وردة أو تثبت فاعليتها.