إشعار
يتطلب الوصول إلى هذه الصفحة تخويلاً. يمكنك محاولة تسجيل الدخول أو تغيير الدلائل.
يتطلب الوصول إلى هذه الصفحة تخويلاً. يمكنك محاولة تغيير الدلائل.
استخدم التقييمات السحابية لاختبار تطبيقات الذكاء الاصطناعي التوليدية على نطاق واسع دون إدارة الحوسبة المحلية. تقوم هذه المقالة بإعداد عميل SDK المشترك وتساعدك على اختيار سير عمل لتقييم ما قبل التوزيع أو الإنتاج.
المتطلبات المسبقه
نشر Azure OpenAI مع نموذج GPT يدعم إكمال الدردشة، مثل
gpt-5-mini.دور مستخدم المسبك في مشروع Foundry.
مهم
تم تغيير اسم أدوار RBAC في Foundry مؤخرا. Foundry User، Foundry Owner، Foundry Account Owner، وFoundry Project Manager تم تسميتها سابقا Azure مستخدم الذكاء الاصطناعي، ومالك الذكاء الاصطناعي Azure، ومالك حساب Azure الذكاء الاصطناعي، ومدير Project الذكاء الاصطناعي Azure. قد ترى الأسماء السابقة في بعض الأماكن أثناء صدور إعادة التسمية. معرفات الأدوار والأذونات الأساسية لم تتغير عند إعادة الاسم.
اختياريا، حساب التخزين الخاص بك لبيانات التقييم.
بعض ميزات التقييم لها قيود إقليمية. راجع المناطق المدعومة قبل البدء.
إعداد عميل SDK
تثبيت SDK للغة الخاصة بك. تعيين متغيرات البيئة المشتركة هذه:
-
AZURE_AI_PROJECT_ENDPOINT: نقطة نهاية مشروع Foundry، على سبيل المثال،https://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: توزيع النموذج الذي يستخدمه المقيمون بمساعدة الذكاء الاصطناعي. -
DATASET_NAMEوDATASET_VERSION: قيم اختيارية لمجموعات البيانات القابلة لإعادة الاستخدام.
قم بالمصادقة باستخدام DefaultAzureCredential، وأنشئ عميل المشروع، واحصل على عميل OpenAI المستخدم من قبل واجهة برمجة تطبيقات التقييم.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
لاستخدام نموذج متصل من خلال اتصالات المسؤول كنموذج هدف أو نموذج القاضي أو محاكي المحادثة، راجع استخدام النماذج المتصلة بالمسؤول في التقييمات السحابية.
فهم سير عمل التقييم
يتكون تقييم السحابة من ثلاث خطوات:
- حدد شكل البيانات والمقيمين الذين يسجلونها.
- إنشاء التقييم باستخدام
openai_client.evals.create(). - ابدأ تشغيلا باستخدام
openai_client.evals.runs.create()، واستقصاء حتى يكتمل، واسترداد النتائج المسجلة.
تخزن نتائج تقييم السحابة في مشروع Foundry الخاص بك. يمكنك استردادها من خلال SDK، أو مراجعتها في المدخل، أو توجيهها إلى Application Insights عند اتصالها.
اختيار المقيمين
يرتبط المقيمون بالحقول في بياناتك من خلال تعيينات الأعمدة. تعرض مهام سير عمل مجموعة البيانات حقول العناصر، بينما تعرض مهام سير العمل التي تم إنشاؤها بواسطة الهدف أيضا إخراج النموذج أو العامل من خلال نموذج المخطط.
راجع المقيمين المضمنينوالمقيمين المخصصين قبل تكوين معايير الاختبار.
اختيار نقطة البداية
| وحدة التقييم | نقطة البداية | سير العمل |
|---|---|---|
| دور فردي | لديك بيانات اختبار JSONL أو CSV مع استعلام واستجابة. | تقييم مجموعات بيانات استجابة الاستعلام |
| دور فردي | لديك استعلامات وتريد نموذجا أو وكيلا لإنشاء استجابات. | تقييم استجابات النموذج والوكيل |
| دور فردي | لقد قمت بتخزين الاستجابات أو التتبعات من التفاعلات الفردية مع نموذج أو عامل تم نشره. | تقييم تفاعلات النموذج والعامل المنشورة |
| دور فردي | تحتاج إلى إنشاء استعلامات اصطناعية. | إنشاء استعلامات اصطناعية |
| إكمال المحادثة | لديك مجموعة بيانات من المحادثات الكاملة. | تقييم مجموعات بيانات المحادثة |
| إكمال المحادثة | لديك آثار تلتقط محادثات كاملة مع نموذج أو عامل تم نشره. | تقييم محادثات النموذج والوكيل المنشورة |
| إكمال المحادثة | تحتاج إلى إنشاء محادثات الوكيل المحاكي وتقييمها. | محاكاة محادثات الوكيل |
| أي وحدة تقييم | تحتاج إلى الاستقصاء عن تشغيل أو تفسيره أو إلغائه أو استكشاف الأخطاء وإصلاحها. | الحصول على نتائج التقييم |
لاختبار الأمان المتطفل، استخدم فريق الذكاء الاصطناعي الأحمر. لإنشاء مجموعة بيانات مستقلة، راجع إنشاء مجموعة بيانات تقييم اصطناعية.