Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Gunakan evaluasi cloud untuk menguji aplikasi AI generatif dalam skala besar tanpa mengelola komputasi lokal. Artikel ini menyiapkan klien SDK bersama dan membantu Anda memilih alur kerja untuk predeployment atau evaluasi produksi.
Prasyarat
Sebuah proyek Foundry.
Penyebaran Azure OpenAI dengan model GPT yang mendukung penyelesaian obrolan, seperti
gpt-5-mini.Peran Pengguna Foundry pada proyek Foundry.
Important
Peran Foundry RBAC baru-baru ini diubah namanya. Pengguna Foundry, Pemilik Foundry, Pemilik Akun Foundry, dan Manajer Proyek Foundry sebelumnya bernama Pengguna Azure AI, Pemilik Azure AI, Pemilik Akun Azure AI, dan Manajer Proyek Azure AI. Anda mungkin masih melihat nama sebelumnya di beberapa tempat saat penggantian nama diluncurkan. ID peran dan izin inti tidak berubah oleh penggantian nama.
Secara opsional, akun penyimpanan Anda sendiri untuk data evaluasi.
Beberapa fitur evaluasi memiliki batasan regional. Tinjau wilayah yang didukung sebelum Anda mulai.
Menyiapkan klien SDK
Instal SDK untuk bahasa Anda. Atur variabel lingkungan bersama ini:
-
AZURE_AI_PROJECT_ENDPOINT: Titik akhir proyek Foundry Anda, misalnya,https://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: Penerapan model yang digunakan oleh evaluator berbantuan AI. -
DATASET_NAMEdanDATASET_VERSION: Nilai opsional untuk himpunan data yang dapat digunakan kembali.
Autentikasi dengan DefaultAzureCredential, buat klien proyek, dan dapatkan klien OpenAI yang digunakan oleh API evaluasi.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Untuk menggunakan model yang terhubung melalui koneksi admin sebagai target, model hakim, atau simulator percakapan, lihat Menggunakan model yang terhubung dengan admin dalam evaluasi cloud.
Memahami alur kerja evaluasi
Evaluasi cloud memiliki tiga langkah:
- Tentukan bentuk data dan evaluator yang menilainya.
- Buat evaluasi dengan
openai_client.evals.create(). - Mulai proses dengan
openai_client.evals.runs.create(), lakukan polling hingga prosesnya selesai, dan ambil hasil penilaiannya.
Hasil evaluasi cloud disimpan dalam proyek Foundry Anda. Anda dapat mengambilnya melalui SDK, meninjaunya di portal, atau merutekannya ke Application Insights saat tersambung.
Pilih evaluator
Evaluator mengikat bidang dalam data Anda melalui pemetaan kolom. Alur kerja himpunan data mengekspos bidang item, sementara alur kerja yang dihasilkan target juga mengekspos model atau output agen melalui skema sampel.
Tinjau evaluator bawaan dan evaluator kustom sebelum Anda mengonfigurasi kriteria pengujian.
Pilih titik awal Anda
| Titik awal | Workflow |
|---|---|
| Anda memiliki data pengujian JSONL atau CSV dengan kueri dan respons. | Mengevaluasi himpunan data di cloud |
| Anda memiliki kueri dan ingin model atau agen menghasilkan respons. | Mengevaluasi model dan agen di cloud |
| Anda telah menerapkan model atau agen dengan jejak pelacakan Application Insights. | Mengevaluasi interaksi agen dan model yang disebarkan |
| Anda memiliki data percakapan lengkap atau jejak percakapan produksi. | Mengevaluasi percakapan di cloud |
| Anda memerlukan kueri sintetis atau percakapan yang disimulasikan. | Hasilkan data sintetis |
| Anda perlu melakukan polling, menginterpretasikan, membatalkan, atau memecahkan masalah eksekusi. | Dapatkan hasil evaluasi cloud |
Untuk pengujian keamanan adversarial, gunakan AI red teaming. Untuk membuat himpunan data mandiri, lihat Membuat himpunan data evaluasi sintetis.