لوحات النماذج في بوابة Microsoft Foundry (معاينة)

مهم

العناصر التي تم تمييزها (معاينة) في هذا المقال حاليا في المعاينة العامة. يتم توفير هذا العرض التمهيدي دون اتفاقية على مستوى الخدمة، ولا نوصي به لأعباء العمل الإنتاجية. قد لا تكون بعض الميزات مدعومة أو قد تكون ذات قدرات محدودة. لمزيد من المعلومات، راجع شروط الاستخدام الإضافية لمعاينات Microsoft Azure.

تساعدك لوحات متصدري النماذج في مدخل Foundry على مقارنة النماذج في كتالوج نموذج Foundry باستخدام معايير النماذج القياسية في الصناعة.

يمكنك مراجعة منهجية المقارنة التفصيلية لكل فئة من فئة لوحة المتصدرين:

  • المقارنة الدقيقة الجيدة لنماذج اللغة لفهم مدى أداء النماذج في المهام الأساسية بما في ذلك التفكير، والمعرفة، والإجابة على الأسئلة، والرياضيات، والبرمجة.
  • مقارنة معايير السلامة لنماذج اللغة لفهم مدى أمان النماذج ضد توليد السلوكيات الضارة.
  • مقارنة الأداء لنماذج اللغة لفهم كيفية أداء النماذج من حيث زمن الاستجابة ومعدل النقل.
  • مقارنة التكلفة لنماذج اللغة لفهم التكلفة المقدرة لاستخدام النماذج.
  • مقارنة لوحات السيناريوهات لنماذج اللغة لمساعدتك في العثور على أفضل نموذج لحالتك أو سيناريوك المحدد.
  • مقارنة الجودة لنماذج التضمين لفهم مدى أداء النماذج في المهام القائمة على التضمين بما في ذلك البحث والاسترجاع.

عندما تجد نموذجا مناسبا، يمكنك فتح نتائج المقارنة التفصيلية الخاصة به في كتالوج النماذج. من هناك، يمكنك نشر النموذج، أو تجربته في الملعب، أو تقييمه بناء على بياناتك الخاصة. تدعم لوحات المتصدرين المقارنة المرجعية لنماذج لغات النص (بما في ذلك نماذج اللغة الكبيرة (LLMs) ونماذج اللغة الصغيرة (SLMs)) ونماذج التضمين.

تقيم معايير النماذج نماذج اللغة الكبيرة ونماذج SLM عبر الجودة والسلامة والتكلفة وسرعة النقل. يتم تقييم نماذج التضمين باستخدام معايير الجودة القياسية. يتم تحديث لوحات المتصدرين مع توفر نماذج جديدة ومجموعات بيانات معيارية.

نطاق مقارنة النماذج

تتميز لوحات المتصدرين بالنماذج بمجموعة مختارة من نماذج اللغة النصية من كتالوج نماذج Foundry. يتم تضمين النماذج بناء على المعايير التالية:

  • نماذج المسبك التي تباعها Azure الأولوية: يتم اختيار النماذج التي يبيعها Azure لتناسب سيناريوهات الذكاء الاصطناعي التوليدي الشائعة.
  • تطبيق المعيار الأساسي: يجب أن تدعم النماذج المهام اللغوية العامة مثل التفكير، والمعرفة، والإجابة على الأسئلة، والاستدلال الرياضي، والبرمجة. النماذج المتخصصة (مثل طي البروتينات أو ضمان الجودة الخاص بالمجال) وغيرها من الأساليب غير مدعومة.

يضمن هذا النطاق أن تعكس لوحات المتصدرين نماذج حديثة عالية الجودة ذات صلة بسيناريوهات الذكاء الاصطناعي الأساسية.

تفسير نتائج لوحة المتصدرين

تساعدك لوحات المتصدرين على مقارنة النماذج عبر عدة أبعاد حتى تتمكن من اختيار النموذج المناسب لحالتك. إليك بعض الإرشادات لتفسير النتائج:

  • مؤشر الجودة: يشير مؤشر الجودة الأعلى إلى أداء عام أقوى عبر مهام التفكير، البرمجة، الرياضيات، والمعرفة. قارن مؤشر الجودة عبر النماذج لتحديد أفضل المؤدين لمهام اللغة العامة.
  • درجات السلامة: تشير معدلات نجاح الهجوم المنخفضة إلى نماذج أكثر قوة. ضع في اعتبارك درجات السلامة إلى جانب درجات الجودة، خاصة للتطبيقات التي تواجه العملاء حيث تكون المخرجات الضارة مصدر قلق كبير.
  • مقايضات الأداء: استخدم مقاييس التأخير ومعدل النقل لفهم استجابة النموذج في العالم الحقيقي. قد لا يناسب النموذج ذو الجودة العالية ولكن التأخير العالي للتطبيقات في الوقت الحقيقي.
  • اعتبارات التكلفة: يستخدم مقياس التكلفة المقدرة نسبة رمز مدخل إلى إخراج ثلاثة إلى واحد. عدل توقعاتك بناء على نسبة الإدخال إلى الإخراج الفعلي في عبء عملك.
  • لوحات الصدارة للسيناريوهات: إذا كانت حالة استخدامك تتوافق مع سيناريو معين (مثل البرمجة أو الرياضيات)، ابدأ بلوحة المتصدرين للسيناريو للعثور على نماذج محسنة لتلك المهمة بدلا من الاعتماد فقط على مؤشر الجودة العام.

نصيحة

توفر معايير لوحة المتصدرين مقارنات موحدة عبر النماذج باستخدام مجموعات بيانات عامة. لتقييم أداء النموذج بناء على بياناتك وحالة الاستخدام الخاصة بك، راجع تقييم تطبيقات الذكاء الاصطناعي التوليدي الخاصة بك.

معايير الجودة لنماذج اللغة

تقوم فاوندري بتقييم جودة نماذج اللغة الكبيرة ونماذج SLM باستخدام درجات الدقة من مجموعات بيانات معيارية قياسية تقيس قدرات التفكير، والمعرفة، والإجابة على الأسئلة، والرياضيات، والبرمجة.

الفهرس الوصف
مؤشر الجودة يتم حسابها عن طريق متوسط درجات الدقة القابلة للتطبيق (exact_match, pass@1, arena_hard) عبر مجموعات البيانات المعيارية.

تتراوح قيم مؤشرات الجودة من صفر إلى واحد، حيث تشير القيم الأعلى إلى أداء أفضل. مجموعات البيانات المدرجة في مؤشر الجودة هي:

اسم مجموعة البيانات الفئة
bigbench_hard (تم تقليل العينة إلى 1000 مثال) الأسباب
كيمبنش الكيمياء
علم الحدود الاستدلال العلمي
GPQA أسئلة وجود
MBPPPLUS الترميز
mmlu_pro (تم تقليل العينة إلى 1000 مثال) المعرفة العامة
موسر الأسباب
tau2_telecom اختيار الوكلاء واختيار استدعاء الأدوات

انظر المزيد من التفاصيل في درجات الدقة:

القياس الوصف
الدقة تتوفر درجات الدقة على مستوى مجموعة البيانات والنموذج. على مستوى مجموعة البيانات، الدرجة هي القيمة المتوسطة لمقياس الدقة المحسوبة على جميع الأمثلة في مجموعة البيانات. مقياس الدقة المستخدم في exact_match جميع الحالات، باستثناء مجموعات بيانات HumanEvalوMBPP التي تستخدم مقياسا pass@1 . المطابقة الدقيقة تقارن النص المنشأ من النموذج مع الإجابة الصحيحة وفقا لمجموعة البيانات، حيث يبلغ عن واحد إذا تطابق النص المولد الإجابة تماما، وصفر بخلاف ذلك. يقيس المقياس pass@1 نسبة حلول النماذج التي تجتاز مجموعة من اختبارات الوحدة في مهمة توليد الشيفرة. على مستوى النموذج، درجة الدقة هي متوسط دقة مجموعة البيانات لكل نموذج.

تتراوح درجات الدقة من صفر إلى واحد، حيث تكون القيم الأعلى أفضل.

معايير السلامة لنماذج اللغة

يتم اختيار معايير السلامة من خلال عملية تصفية وتحقق منظمة تهدف إلى ضمان الصلة والدقة. يؤهل المعيار للانضمام إذا كان يعالج المخاطر ذات الأولوية العالية. تتضمن لوحات المتصدرين للسلامة معايير موثوقة بما يكفي لتقديم إشارات ذات معنى حول مواضيع تهم فيما يتعلق بالسلامة. تستخدم لوحات المتصدرين HarmBench لتمثيل سلامة النمذجة، وتنظم لوحات المتصدرين للسيناريوهات كما يلي:

اسم مجموعة البيانات سيناريو لوحة المتصدرين القياس التفسير
هارمبنش (القياس) السلوكيات الضارة القياسية معدل نجاح الهجوم القيم المنخفضة تعني متانة أفضل ضد الهجمات المصممة لاستدعاء محتوى ضار قياسي
هارمبنش (سياقي) السلوكيات الضارة في السياق معدل نجاح الهجوم القيم المنخفضة تعني متانة أفضل ضد الهجمات المصممة لإثارة محتوى ضار في السياق
HarmBench (انتهاكات حقوق النشر) انتهاكات حقوق النشر معدل نجاح الهجوم تشير القيم المنخفضة إلى متانة أقوى ضد انتهاكات حقوق النشر
WMDP المعرفة في المجالات الحساسة الدقة تشير القيم الأعلى إلى معرفة أكبر في المجالات الحساسة
توكسيجين اكتشاف المحتوى السام درجة F1 تشير القيم الأعلى إلى أداء أفضل في الكشف

كشف السلوك الضار

يقيس معيار HarmBench السلوكيات الضارة باستخدام محفزات مصممة لتحفيز ردود غير آمنة. يغطي سبع فئات دلالية:

  • الجرائم الإلكترونية والتسلل غير المصرح به
  • الأسلحة الكيميائية والبيولوجية أو الأدوية
  • انتهاكات حقوق النشر
  • المعلومات المضللة والمضللة
  • التحرش والتنمر
  • الأنشطة غير القانونية
  • الضرر العام

تجمع هذه الفئات في ثلاث مجالات وظيفية:

  • السلوكيات الضارة القياسية
  • السلوكيات الضارة في السياق
  • انتهاكات حقوق النشر

كل فئة وظيفية تظهر في لوحة متصدرين منفصلة للسيناريوهات. يستخدم التقييم توجيهات مباشرة من HarmBench (بدون هجمات) ومقيمو HarmBench لحساب معدل نجاح الهجوم (ASR). القيم المنخفضة لنسبة ASR تعني نماذج أكثر أمانا. لا تستخدم استراتيجيات هجوم للتقييم، ويتم إجراء مقارنة النماذج مع إيقاف Foundry Guardrails (التي كانت تعرف سابقا بفلاتر المحتوى).

اكتشاف المحتوى السام

توكسيجين هو مجموعة بيانات واسعة النطاق لاكتشاف خطاب الكراهية العدائي والضمني. ويشمل ذلك أحكاما سامة وغير ضمنية تشير إلى 13 مجموعة أقلية. تستخدم فاوندري عينات توكسيجين مشروحة وتحسب درجات F1 لقياس أداء التصنيف. تشير الدرجات الأعلى إلى اكتشاف أفضل للمحتوى السام. يتم إجراء المقارنة مع إيقاف Foundry Guardrails (سابقا فلاتر المحتوى).

معرفة المجال الحساس

يقيس معيار وكيلة أسلحة الدمار الشامل (WMDP) معرفة النماذج في مجالات حساسة تشمل الأمن البيولوجي، الأمن السيبراني، والأمن الكيميائي. تستخدم لوحة المتصدرين متوسط درجات الدقة في مجالات الأمن السيبراني، والأمن البيولوجي، والأمن الكيميائي. درجة دقة أسلحة الإشامل الشاملة الأعلى تعني معرفة أكبر بالقدرات الخطرة (سلوك أسوأ من ناحية السلامة). يتم إجراء اختبار النماذج مع تشغيل حواجز الحماية الافتراضية (التي كانت تعرف سابقا بمرشحات المحتوى). هذه الحواجز تكشف وتمنع أضرار المحتوى في العنف، وإيذاء النفس، والجنس، والكراهية، والظلم، لكنها لا تستهدف فئات الأمن السيبراني، والأمن البيولوجي، والأمن الكيميائي.

قيود معايير السلامة

السلامة موضوع معقد له عدة أبعاد. لا يوجد معيار مفتوح المصدر واحد يمكنه اختبار أو تمثيل السلامة الكاملة للنظام عبر جميع السيناريوهات. بالإضافة إلى ذلك، تعاني العديد من المعايير من تشبع أو عدم توافق بين تصميم المعيار وتعريف المخاطر. بعض المعايير تفتقر أيضا إلى توثيق واضح حول كيفية تصور وتنفيذ مخاطر الأهداف، مما يصعب تقييم ما إذا كانت النتائج تلتقط بدقة تفاصيل المخاطر الواقعية. يمكن أن تؤدي هذه القيود إلى المبالغة في تقدير أو التقليل من أداء النموذج في سيناريوهات السلامة الواقعية.

معايير الأداء لنماذج اللغة

تجمع مقاييس الأداء البيانات على مدى 14 يوما باستخدام 24 تجربة في اليوم، مع إرسال طلبين لكل تجربة على فترات ساعة واحدة. ما لم يذكر خلاف ذلك، تنطبق المعايير الافتراضية التالية على كل من نشر واجهة برمجة التطبيقات بدون خادم وعلى Azure OpenAI:

المعلمة القيمة ينطبق على
المنطقة شرق الولايات المتحدة/شرق الولايات المتحدة الأمريكية 2 نشر واجهة برمجة التطبيقات بدون خادم وAzure OpenAI
حد معدل الرموز في الدقيقة (TPM) 30k (180 دورة في الدقيقة مبنية على Azure OpenAI) للنماذج غير المنطقية و100k لنماذج الاستدلال
لا يوجد (نشر واجهات برمجة التطبيقات بدون خادم)
بالنسبة Azure نماذج OpenAI، يمكن للمستخدمين تحديد نطاقات حد المعدل استنادا إلى نوع النشر (واجهة برمجة التطبيقات بلا خادم، والقياسية العمومية، وما إلى ذلك.)
بالنسبة لعمليات نشر واجهات برمجة التطبيقات بدون خادم، يتم تجريد هذا الإعداد.
عدد الطلبات طلبان في التجربة لكل ساعة (24 تجربة يوميا) عمليات نشر واجهة برمجة التطبيقات بلا خادم، Azure OpenAI
عدد التجارب/الجولات 14 يوما مع 24 تجربة يوميا بمعدل 336 نقطة عمليات نشر واجهة برمجة التطبيقات بلا خادم، Azure OpenAI
طول الطلب/السياق الطول المتوسط عمليات نشر واجهة برمجة التطبيقات بلا خادم، Azure OpenAI
عدد الرموز المعالجة (متوسط) نسبة 80:20 لرموز الإدخال إلى الإخراج، أي 800 رمز إدخال مقابل 200 رمز إخراج. عمليات نشر واجهة برمجة التطبيقات بلا خادم، Azure OpenAI
عدد الطلبات المتزامنة واحد (الطلبات ترسل بشكل متسلسل واحدة تلو الأخرى) عمليات نشر واجهة برمجة التطبيقات بلا خادم، Azure OpenAI
البيانات التركيبي (ملاحظات إدخال معدة من نص ثابت) عمليات نشر واجهة برمجة التطبيقات بلا خادم، Azure OpenAI
نوع النشر واجهة برمجة التطبيقات بدون خادم ينطبق فقط على Azure OpenAI
البث المباشر صحيح ينطبق على عمليات نشر واجهات برمجة التطبيقات بدون خادم وAzure OpenAI. بالنسبة للنماذج التي يتم نشرها عبر الحوسبة المدارة، أو لنقاط النهاية عندما لا يدعم البث، يمثل TTFT كمعيار P50 بمقياس الكمون.
سكو Standard_NC24ads_A100_v4 (24 نواة، 220 جيجابايت رام، 64 جيجابايت تخزين) ينطبق فقط على الحوسبة المدارة (لتقدير مقاييس التكلفة والأداء)

يتم تقييم أداء نماذج اللغة الكبيرة ونماذج التعلم العميق عبر المقاييس التالية:

القياس الوصف
متوسط الكمون متوسط الوقت بالثواني لمعالجة طلب، محسوب عبر عدة طلبات. يتم إرسال طلب إلى نقطة النهاية كل ساعة لمدة أسبوعين، ويتم حساب المتوسط.
زمن الاستجابة P50 التأخير الوسيط (50 percent). تم إكمال 50% من الطلبات خلال هذه الفترة.
زمن الاستجابة P90 زمن الاستجابة في النسبة المئوية 90. 90% من الطلبات اكتملت خلال هذه الفترة.
زمن الاستجابة P95 زمن الاستجابة المئوية 95. 95% من الطلبات مكتملة خلال هذه الفترة.
زمن الاستجابة P99 زمن الاستجابة المئوية 99. 99% من الطلبات اكتملت خلال هذا الوقت.
معدل النقل GTPS الرموز المميزة التي تم إنشاؤها في الثانية (GTPS) هي عدد رموز الإخراج المميزة التي تم إنشاؤها في الثانية من وقت إرسال الطلب إلى نقطة النهاية.
معدل النقل TTPS إجمالي الرموز في الثانية (TTPS) هو عدد الرموز المعالجة في الثانية بما في ذلك كل من التعليمات المتداولة والرموز المولدة من التوصيلات الناتجة. بالنسبة للنماذج التي لا تدعم الدفق، يمثل وقت الرمز المميز الأول (TTFT) قيمة P50 لزمن الانتقال (الوقت المستغرق لتلقي الاستجابة)
زمن الاستجابة TTFT إجمالي الوقت للوصول إلى أول رمز (TTFT) هو الوقت الذي يستغرقه إرجاع أول رمز في الرد من نقطة النهاية عند تفعيل البث.
الوقت بين الرموز هذا المقياس هو الوقت بين الرموز المستلمة.

بالنسبة لمقاييس الأداء مثل التأخير أو معدل النقل، فإن الوقت حتى أول رمز والرموز المولدة في الثانية تعطي فكرة أفضل عن الأداء والسلوك النموذجي للنموذج. يتم تحديث أرقام الأداء بشكل دوري لتعكس أحدث تكوينات النشر.

معايير التكلفة لنماذج اللغة

تقيس معايير التكلفة التكلفة الفعلية لتنفيذ كل نموذج على مجموعات بيانات معايير الجودة، بدلا من تقدير التكلفة بناء على تسعير الرمز.

يتم حساب تكلفة المعيار باستخدام:

  • العدد الفعلي لرموز المدخلات والاستدلال والمخرجات التي تم استهلاكها أثناء تنفيذ الاختبارات المعيارية.
  • تكوين جهد التفكير الخاص بالنموذج المستخدم للتقييم (عادة high أو xhigh).
  • خصائص وتعقيد مجموعة البيانات، والتي تؤثر على استخدام الرموز ووقت التشغيل.

على عكس التقديرات المبنية على نسبة رموز ثابتة، يعكس هذا النهج التكلفة الحقيقية من البداية إلى النهاية لتشغيل أحمال العمل المعيارية.

كيفية تفسير نتائج التكلفة

  • يتم الإبلاغ عن التكلفة بالدولار الأمريكي لكل جولة مرجعية عبر مجموعات البيانات ذات الجودة القياسية.
  • تمثل القيم تكلفة التنفيذ الحقيقية وتمكن من المقارنة المباشرة بين النماذج.
  • تشير القيم المنخفضة إلى أداء أكثر كفاءة من حيث التكلفة على مجموعة الاختبارات المرجعية.

مقارنة السيناريوهات في لوحة المتصدرين

تجمع لوحات المتصدرين للسيناريو مجموعات البيانات المرجعية حسب أهداف تقييم مشتركة في العالم الحقيقي. يمكنك بسرعة تحديد نقاط القوة والضعف للنموذج حسب حالة الاستخدام. كل سيناريو يجمع مجموعة بيانات أو أكثر من معايير المرجع العامة.

استخدم الجدول التالي للعثور على حالة الاستخدام في عمود السيناريو ، ثم راجع مجموعات بيانات المعيار المرجعي المرتبطة وما تشير إليه النتائج. يلخص الجدول التالي لوحات المتصدرين المتاحة للسيناريوهات ومجموعات البيانات والوصف المرتبطة بها:

السيناريو مجموعات البيانات الوصف
السلوك الضار القياسي هارمبنش (القياس) معدل نجاح الهجوم على المحفزات الضارة القياسية. الانخفاض أفضل. انظر كشف السلوك الضار.
السلوك الضار السياقي هارمبنش (سياقي) معدل نجاح الهجوم على المحفزات الضارة في السياق. الانخفاض أفضل. انظر كشف السلوك الضار.
انتهاكات حقوق النشر هارم بنش (حقوق الطبع والنشر) معدل نجاح الهجوم على طلبات انتهاك حقوق النشر. الانخفاض أفضل. انظر كشف السلوك الضار.
المعرفة في المجالات الحساسة WMDP (الأمن البيولوجي، الأمن الكيميائي، الأمن السيبراني) الدقة عبر ثلاثة مجموعات فرعية حساسة من المجالات. الدقة الأعلى تشير إلى معرفة أكبر بالقدرات الحساسة. انظر المعرفة الحساسة في المجالات.
اكتشاف السمية توكسيجين (مشروط) درجة F1 لقدرة اكتشاف المحتوى السام. أعلى هو أفضل. انظر اكتشاف المحتوى السام.
الأسباب BIG-Bench هارد (1000 فرع فرعي) تقييم قدرات التفكير. القيم الأعلى أفضل.
الترميز BigCodeBench (إرشاد)، LiveBench (ترميز)، LiveCodeBench MediumMBPPPlus يقيس الدقة في المهام المتعلقة بالشيفرة. القيم الأعلى أفضل.
المعرفة العامة MMLU-Pro (نموذج فرعي إنجليزي 1K) 1000 مثال من نموذج فرعي إنجليزي فقط من MMLU-Pro.
سؤال وأجوبة أرينا-هارد، GPQA (الماس) ضمان جودة التفضيل البشري المعارض (Arena-Hard) وضمان الجودة متعدد التخصصات على مستوى الدراسات العليا (GPQA Diamond). القيم الأعلى أفضل.
الرياضيات الرياضيات (500 عينة فرعية) يقيس قدرات الاستدلال الرياضي لنماذج اللغة. القيم الأعلى أفضل.
الثبات تروثفول كيو إيه (MC1) تقييم الأساس / الصدق متعدد الخيارات لنماذج اللغة. القيم الأعلى أفضل.

معايير الجودة لنماذج التضمين

يعرف مؤشر الجودة لنماذج التضمين بأنه متوسط درجات الدقة لمجموعة شاملة من مجموعات بيانات واجهة برمجة التطبيقات بدون خادم تستهدف مهام استرجاع المعلومات، وتجميع المستندات، ومهام التلخيص.

القياس الوصف
الدقة الدقة هي نسبة التنبؤات الصحيحة بين إجمالي عدد التنبؤات المعالجة.
درجة F1 درجة F1 هي المتوسط المرجح للدقة والاستدعاء، حيث تكون أفضل قيمة واحدة (الدقة الكاملة والاستدعاء)، والأسوأ هي صفر.
متوسط الدقة المتوسطة (MAP) تقوم MAP بتقييم جودة أنظمة التصنيف والتوصية. يقيس كل من أهمية العناصر المقترحة ومدى كفاءة النظام في وضع العناصر الأكثر صلة في القمة. يمكن أن تتراوح القيم من صفر إلى واحد، وكلما ارتفعت MAP، كان النظام أفضل في وضع العناصر ذات الصلة في أعلى القائمة.
الربح التراكمي المخصوم المعدل (NDCG) يقوم NDCG بتقييم قدرة خوارزمية التعلم الآلي على فرز العناصر بناء على الصلة. يقارن التصنيف بترتيب مثالي حيث تكون جميع العناصر ذات الصلة في أعلى القائمة، حيث k هو طول القائمة أثناء تقييم جودة الترتيب. في هذه المعايير، k=10، المشار إليه بمقياس ل ndcg_at_10، مما يعني أن أفضل 10 عناصر يتم تقييمها.
الدقة تقيس الدقة قدرة النموذج على تحديد حالات من فئة معينة بشكل صحيح. تظهر الدقة مدى تكرار صحة نموذج التعلم الآلي عند التنبؤ بالفئة المستهدفة.
ارتباط سبيرمان يتم حساب ارتباط سبيرمان بناء على تشابه جيب تمام، أولا عن طريق حساب تشابه جيب تمام بين المتغيرات، ثم ترتيب هذه الدرجات واستخدام الرتب لحساب ارتباط سبيرمان.
مقياس V مقياس V هو مقياس يستخدم لتقييم جودة التجميع. يحسب مقياس V كمتوسط توافقي للتجانس والاكتمال، مما يضمن توازنا بين الاثنين للحصول على درجة ذات معنى. الدرجات الممكنة تقع بين صفر وواحد، حيث واحدة هي تسمية كاملة تماما.

حساب الدرجات

الدرجات الفردية

تأتي نتائج المعيار من مجموعات بيانات عامة تستخدم عادة لتقييم نماذج اللغة. في معظم الحالات، يتم استضافة البيانات في مستودعات GitHub التي يديرها المبدعون أو القيمون على البيانات. تقوم خطوط تقييم المصانع بتنزيل البيانات من مصادرها الأصلية، واستخراج المحفزات من كل صف مثال، وتوليد استجابات النماذج، ثم حساب مقاييس الدقة ذات الصلة.

يتبع بناء الأوامر أفضل الممارسات لكل مجموعة بيانات، كما هو محدد في الورقة التي تقدم مجموعة البيانات ومعايير الصناعة. في معظم الحالات، يحتوي كل محفز على عدة لقطات، أي عدة أمثلة على أسئلة وإجابات كاملة لتحضير النموذج للمهمة. يختلف عدد الطلقات حسب مجموعة البيانات ويتبع المنهجية المحددة في النشر الأصلي لكل مجموعة بيانات. تنتج خطوط التقييم لقطات من خلال أخذ عينات من الأسئلة والأجوبة من جزء من البيانات التي تم الاحتفاظ بها أثناء التقييم.

قيود المعيار

جميع المعايير لها قيود جوهرية يجب أن تأخذها في الاعتبار عند تفسير النتائج:

  • معايير الجودة: يمكن أن تصبح مجموعات بيانات المعيار مشبعة مع مرور الوقت مع تدريب أو ضبط النماذج على بيانات مماثلة. قد تختلف نتائج التقييم أيضا حسب البناء السريع وعدد الأمثلة القليلة المستخدمة.
  • معايير الأداء: يتم جمع المقاييس باستخدام أحمال عمل اصطناعية ذات نسبة رموز ثابتة من الإدخال إلى الإخراج ونشرات منطقة واحدة. قد يختلف الأداء في العالم الحقيقي بناء على أنماط عبء العمل، والتزامن، والمنطقة، وتكوين النشر.
  • معايير التكلفة: تستند تقديرات التكلفة إلى نسبة رمز المدخل إلى المخرج ثلاثة إلى واحد والتسعير الحالي في وقت القياس. التكاليف الفعلية تعتمد على عبء العمل الخاص بك وتخضع لتغيرات في الأسعار.