Menjalankan evaluasi cloud dengan Microsoft Foundry SDK

Gunakan evaluasi cloud untuk menguji aplikasi AI generatif dalam skala besar tanpa mengelola komputasi lokal. Artikel ini menyiapkan klien SDK bersama dan membantu Anda memilih alur kerja untuk predeployment atau evaluasi produksi.

Prasyarat

  • Sebuah proyek Foundry.

  • Penyebaran Azure OpenAI dengan model GPT yang mendukung penyelesaian obrolan, seperti gpt-5-mini.

  • Peran Pengguna Foundry pada proyek Foundry.

    Important

    Peran Foundry RBAC baru-baru ini diubah namanya. Pengguna Foundry, Pemilik Foundry, Pemilik Akun Foundry, dan Manajer Proyek Foundry sebelumnya bernama Pengguna Azure AI, Pemilik Azure AI, Pemilik Akun Azure AI, dan Manajer Proyek Azure AI. Anda mungkin masih melihat nama sebelumnya di beberapa tempat saat penggantian nama diluncurkan. ID peran dan izin inti tidak berubah oleh penggantian nama.

  • Secara opsional, akun penyimpanan Anda sendiri untuk data evaluasi.

Beberapa fitur evaluasi memiliki batasan regional. Tinjau wilayah yang didukung sebelum Anda mulai.

Menyiapkan klien SDK

Instal SDK untuk bahasa Anda. Atur variabel lingkungan bersama ini:

  • AZURE_AI_PROJECT_ENDPOINT: Titik akhir proyek Foundry Anda, misalnya, https://<account_name>.services.ai.azure.com/api/projects/<project_name>.
  • AZURE_AI_MODEL_DEPLOYMENT_NAME: Penerapan model yang digunakan oleh evaluator berbantuan AI.
  • DATASET_NAME dan DATASET_VERSION: Nilai opsional untuk himpunan data yang dapat digunakan kembali.

Autentikasi dengan DefaultAzureCredential, buat klien proyek, dan dapatkan klien OpenAI yang digunakan oleh API evaluasi.

pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
    CreateEvalJSONLRunDataSourceParam,
    SourceFileContent,
    SourceFileContentContent,
    SourceFileID,
)

endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
    "AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")

project_client = AIProjectClient(
    endpoint=endpoint,
    credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()

Untuk menggunakan model yang terhubung melalui koneksi admin sebagai target, model hakim, atau simulator percakapan, lihat Menggunakan model yang terhubung dengan admin dalam evaluasi cloud.

Memahami alur kerja evaluasi

Evaluasi cloud memiliki tiga langkah:

  1. Tentukan bentuk data dan evaluator yang menilainya.
  2. Buat evaluasi dengan openai_client.evals.create().
  3. Mulai proses dengan openai_client.evals.runs.create(), lakukan polling hingga prosesnya selesai, dan ambil hasil penilaiannya.

Hasil evaluasi cloud disimpan dalam proyek Foundry Anda. Anda dapat mengambilnya melalui SDK, meninjaunya di portal, atau merutekannya ke Application Insights saat tersambung.

Pilih evaluator

Evaluator mengikat bidang dalam data Anda melalui pemetaan kolom. Alur kerja himpunan data mengekspos bidang item, sementara alur kerja yang dihasilkan target juga mengekspos model atau output agen melalui skema sampel.

Tinjau evaluator bawaan dan evaluator kustom sebelum Anda mengonfigurasi kriteria pengujian.

Pilih titik awal Anda

Titik awal Workflow
Anda memiliki data pengujian JSONL atau CSV dengan kueri dan respons. Mengevaluasi himpunan data di cloud
Anda memiliki kueri dan ingin model atau agen menghasilkan respons. Mengevaluasi model dan agen di cloud
Anda telah menerapkan model atau agen dengan jejak pelacakan Application Insights. Mengevaluasi interaksi agen dan model yang disebarkan
Anda memiliki data percakapan lengkap atau jejak percakapan produksi. Mengevaluasi percakapan di cloud
Anda memerlukan kueri sintetis atau percakapan yang disimulasikan. Hasilkan data sintetis
Anda perlu melakukan polling, menginterpretasikan, membatalkan, atau memecahkan masalah eksekusi. Dapatkan hasil evaluasi cloud

Untuk pengujian keamanan adversarial, gunakan AI red teaming. Untuk membuat himpunan data mandiri, lihat Membuat himpunan data evaluasi sintetis.