إشعار
يتطلب الوصول إلى هذه الصفحة تخويلاً. يمكنك محاولة تسجيل الدخول أو تغيير الدلائل.
يتطلب الوصول إلى هذه الصفحة تخويلاً. يمكنك محاولة تغيير الدلائل.
تتطلب دورة حياة تطبيقات الذكاء الاصطناعي أطر تقييم قوية لضمان أن أنظمة الذكاء الاصطناعي تقدم مخرجات دقيقة وذات صلة وموثوقة. بدون تقييم دقيق، تخاطر أنظمة الذكاء الاصطناعي بتوليد ردود غير دقيقة، أو غير متسقة، أو غير مبنية على الأرض، أو قد تكون ضارة. تمكن إمكانية المراقبة الفرق من قياس وتحسين كل من جودة وسلامة مخرجات الذكاء الاصطناعي طوال دورة حياة التطوير - من اختيار النموذج من خلال مراقبة الإنتاج.
ما هي قابلية الملاحظة؟
تشير قابلية الرصد في الذكاء الاصطناعي إلى القدرة على مراقبة وفهم وحل المشكلات في أنظمة الذكاء الاصطناعي طوال دورة حياتها. يمكنك تتبع وتقييم ودمج بوابات الجودة الآلية في خطوط أنابيب CI/CD، وجمع إشارات مثل مقاييس التقييم، والسجلات، والتتبعات، ومخرجات النماذج للحصول على رؤية حول الأداء والجودة والسلامة والصحة التشغيلية.
قدرات الملاحظة الأساسية
توفر Microsoft Foundry ثلاث قدرات أساسية تعمل معا لتوفير ملاحظة شاملة عبر دورة حياة تطبيقات الذكاء الاصطناعي:
التقييم
يقيس المقيمون جودة وسلامة وموثوقية استجابات الذكاء الاصطناعي طوال فترة التطوير. توفر Microsoft Foundry مقيمين مدمجين تشمل مقاييس الجودة العامة (التماسك، الطلاقة)، مقاييس خاصة ب RAG (الثبات، الصلة)، السلامة والأمان (الكراهية/الظلم، العنف، المواد المحمية)، ومقاييس خاصة بالوكلاء (دقة استدعاءات الأدوات، إكمال المهام)، من بين أمور أخرى. يمكنك أيضا بناء مقيمين مخصصين يتناسب مع متطلباتك الخاصة بالمجال.
للحصول على قائمة كاملة بالمقيمين المدمجين، انظر مرجع المقيمين المدمجين.
المراقبة
تضمن مراقبة الإنتاج أن تحافظ تطبيقات الذكاء الاصطناعي المنتشرة على الجودة والأداء في ظروف العالم الحقيقي. مدمجة مع Azure Monitor Application Insights، تقدم Microsoft Foundry لوحات معلومات في الوقت الحقيقي تتبع مقاييس التشغيل، واستهلاك الرموز، وفترة التأخير، ومعدلات الأخطاء، ودرجات الجودة. يمكنك إعداد تنبيهات عندما تفشل المخرجات في عتبات الجودة أو تنتج محتوى ضارا، مما يتيح حل سريع للمشكلة.
للحصول على تفاصيل حول إعداد مراقبة الإنتاج، راجع لوحة تحكم الوكلاء في المراقبة.
التتبع
يلتقط التتبع الموزع تدفق تنفيذ تطبيقات الذكاء الاصطناعي، مما يوفر رؤية لاستدعاءات نماذج اللغة الكبيرة (LLM)، واستدعاءات الأدوات، وقرارات الوكلاء، والتبعيات بين الخدمات. مبني على معايير OpenTelemetry ومدمج مع Azure Monitor Application Insights، يتيح التتبع تصحيح سلوكيات الوكلاء المعقدة، وتحديد عنق الزجاجة في الأداء، وفهم سلاسل التفكير متعددة الخطوات. يدعم Microsoft Foundry تتبع الأطر الشهيرة مثل LangChain وLangGraph وOpenAI Agents SDK، وإطار عمل Microsoft Agent.
للحصول على إرشادات حول تنفيذ التتبع، راجع نظرة عامة على وكيل التتبع.
ما هم المقيمون؟
المقيمون هم أدوات متخصصة تقيس جودة وسلامة وموثوقية استجابات الذكاء الاصطناعي طوال دورة حياة التطوير.
للحصول على قائمة كاملة بالمقيمين المدمجين، انظر مرجع المقيمين المدمجين.
يندمج المقيمون في كل مرحلة من مراحل دورة حياة الذكاء الاصطناعي لضمان الموثوقية والسلامة والفعالية.
المراحل الثلاث لتقييم دورة حياة تطبيقات الذكاء الاصطناعي
اختيار النموذج الأساسي
اختر النموذج الأساسي المناسب من خلال مقارنة الجودة، وأداء المهمة، والاعتبارات الأخلاقية، وملفات السلامة عبر نماذج مختلفة.
الأدوات المتاحة: Microsoft Foundry benchmark لمقارنة النماذج على مجموعات البيانات العامة أو بياناتك الخاصة، وحزمة تطوير Azure لتقييم الذكاء الاصطناعي ل اختبار نقاط نهاية محددة للنموذج.
تقييم ما قبل الإنتاج
قبل النشر، يضمن الاختبار الدقيق أن وكيل الذكاء الاصطناعي أو تطبيقك جاهز للإنتاج. تقوم هذه المرحلة بالتحقق من الأداء من خلال مجموعات بيانات التقييم، وتحدد الحالات النادرة، وتقيم المتانة، وتقيس المقاييس الرئيسية بما في ذلك الالتزام بالمهام، وثباتها، والملاءمة، والسلامة. لبناء وكلاء جاهزين للإنتاج مع محادثات متعددة الأدوار، واستدعاء الأدوات، وإدارة الحالة، راجع خدمة وكلاء المسبك.
أدوات وأساليب التقييم:
أحضر بياناتك الخاصة: قيم تطبيقات الذكاء الاصطناعي باستخدام بياناتك الخاصة مع مقيمين ذوي جودة أو أمان أو مقيم مخصص. استخدم معالج تقييم بوابة Foundry أو Foundry SDKواطلع على النتائج في بوابة Foundry.
AI red teaming agent: يقوم عامل الفريق الأحمر AI بمحاكاة الهجمات المعقدة باستخدام إطار عمل PyRIT الخاص ب Microsoft لتحديد ثغرات السلامة والأمان قبل النشر. أفضل استخدام مع عمليات الإنسان في الحلقة.
مراقبة ما بعد الإنتاج
بعد النشر، تضمن المراقبة المستمرة أن تطبيق الذكاء الاصطناعي الخاص بك يحافظ على الجودة في الظروف الواقعية:
- المقاييس التشغيلية: قياس منتظم للمقاييس التشغيلية الرئيسية لوكلاء الذكاء الاصطناعي
- التقييم المستمر: تقييم الجودة والسلامة لحركة الإنتاج بمعدل مأخذ عينات
- التقييم المجدول: تقييم الجودة والسلامة المجدول باستخدام مجموعات بيانات الاختبار لاكتشاف انحراف النظام
- الفرق الحمراء المجدولة: اختبارات عدائية مجدولة للتحقيق في ثغرات السلامة والأمن
- Azure Monitor تنبيهات: الإشعارات عندما تفشل المخرجات في حدود الجودة أو تنتج محتوى ضار
مدمجة مع Azure Monitor Application Insights، تقدم لوحة تحكم Foundry Observability رؤى فورية حول الأداء والسلامة ومقاييس الجودة، مما يتيح حل المشكلات بسرعة والحفاظ على ثقة المستخدمين.
مرجع سريع للتقييم
| الغرض | العملية | المعايير، الإرشاد، والعينات |
|---|---|---|
| كيف أضبط التتبع؟ | تكوين التتبع الموزع |
نظرة عامة على الأثر تتبع مع مجموعة SDK للوكلاء |
| ما الذي تقوم بتقييمه؟ | تحديد أو بناء المقيمين ذوي الصلة |
المقيمون المدمجين المقيمون المخصصون Python عينات SDK <عينات SDK c0 /> |
| ما هي البيانات التي يجب أن تستخدمها؟ | رفع أو إنشاء مجموعة بيانات ذات صلة | اختيار مصدر البيانات |
| كيف أجري التقييمات؟ | تقييم الجولة |
تقييمات الوكيل التشغيل السحابي عن بعد |
| كيف كان أداء تطبيقي للنموذج/الذكاء الاصطناعي؟ | تحليل النتائج |
عرض نتائج التقييم تحليل التجمع |
| كيف يمكنني التحسن؟ | تحليل النتائج وتحسين الوكلاء | تحليل فشل التقييم باستخدام تحليل العنقود. تحسين الوكلاء وإعادة التقييم. راجع نتائج التقييم. |
دعم المنطقة، حدود الأسعار، ودعم الشبكة الافتراضية
لمعرفة المناطق التي تدعم المقيمين المدعومين بالذكاء الاصطناعي، وحدود المعدل التي تنطبق على عمليات التقييم، وكيفية تكوين دعم الشبكة الافتراضية لعزل الشبكة، راجع دعم المناطق، وحدود المعدل، ودعم الشبكة الافتراضية للتقييم.
التسعير
تتم فوترة ميزات إمكانية المراقبة مثل تقييمات وتقييمات المخاطر والسلامة في ملعب العامل استنادا إلى الاستهلاك كما هو موضح في صفحة التسعير Azure.
مهم
يتم تفعيل التقييمات في ساحة الوكلاء بشكل افتراضي لجميع مشاريع Foundry وتدرج في الفوترة القائمة على الاستهلاك. لإيقاف تقييمات الملاعب، اختر المقاييس في أعلى يمين ملعب الوكلاء وألغ تحديد جميع المقيمين.