Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Yerel işlemi yönetmeden üretken yapay zeka uygulamalarını büyük ölçekte test etmek için bulut değerlendirmelerini kullanın. Bu makale, paylaşılan SDK istemcisini ayarlar ve önceden dağıtım veya üretim değerlendirmesi için bir iş akışı seçmenize yardımcı olur.
Prerequisites
örneğin
gpt-5-minigibi sohbet tamamlamayı destekleyen bir GPT modeline sahip bir Azure OpenAI dağıtımı.Dökümhane projesindeki Dökümhane Kullanıcısı rolü.
Important
Foundry RBAC rolleri yakın zamanda yeniden adlandırıldı. Foundry User, Foundry Owner, Foundry Hesabı Sahibi ve Foundry Project Manager daha önce Azure Yapay Zeka Kullanıcısı, Azure Yapay Zeka Sahibi, Azure Yapay Zeka Hesabı Sahibi ve Azure Yapay Zeka Project Yöneticisi olarak adlandırıldı. Yeniden adlandırma kullanıma sunulmaya devam ederken bazı yerlerde önceki adları görmeye devam edebilirsiniz. Rol kimlikleri ve temel izinler yeniden adlandırma ile değiştirilmez.
İsteğe bağlı olarak, değerlendirme verileri için kendi depolama hesabınız .
Bazı değerlendirme özelliklerinin bölgesel kısıtlamaları vardır. Başlamadan önce desteklenen bölgeleri gözden geçirin.
SDK istemcisini ayarlama
Diliniz için SDK'yi yükleyin. Şu paylaşılan ortam değişkenlerini ayarlayın:
-
AZURE_AI_PROJECT_ENDPOINT: Foundry proje uç noktanız, örneğinhttps://<account_name>.services.ai.azure.com/api/projects/<project_name>. -
AZURE_AI_MODEL_DEPLOYMENT_NAME: Yapay zekâ destekli değerlendiricilerin kullandığı modelin dağıtımı. -
DATASET_NAMEveDATASET_VERSION: Yeniden kullanılabilir veri kümeleri için isteğe bağlı değerler.
ile DefaultAzureCredentialkimlik doğrulaması yapın, proje istemcisini oluşturun ve değerlendirme API'sinin kullandığı OpenAI istemcisini alın.
pip install "azure-ai-projects>=2.2.0"
import os
from azure.identity import DefaultAzureCredential
from azure.ai.projects import AIProjectClient
from azure.ai.projects.models import TestingCriterionAzureAIEvaluator
from openai.types.eval_create_params import DataSourceConfigCustom
from openai.types.evals.create_eval_jsonl_run_data_source_param import (
CreateEvalJSONLRunDataSourceParam,
SourceFileContent,
SourceFileContentContent,
SourceFileID,
)
endpoint = os.environ["AZURE_AI_PROJECT_ENDPOINT"]
model_deployment_name = os.environ.get(
"AZURE_AI_MODEL_DEPLOYMENT_NAME", ""
)
dataset_name = os.environ.get("DATASET_NAME", "")
dataset_version = os.environ.get("DATASET_VERSION", "1")
project_client = AIProjectClient(
endpoint=endpoint,
credential=DefaultAzureCredential(),
)
openai_client = project_client.get_openai_client()
Yönetici bağlantıları aracılığıyla bağlı bir modeli hedef, yargıç modeli veya konuşma simülatörü olarak kullanmak için bkz. Bulut değerlendirmelerinde yöneticiye bağlı modelleri kullanma.
Değerlendirme iş akışını anlama
Bulut değerlendirmesinin üç adımı vardır:
- Veri şeklini ve puanlayan değerlendiricileri tanımlayın.
- Değerlendirmeyi
openai_client.evals.create()ile oluşturun. - ile
openai_client.evals.runs.create()bir çalıştırma başlatın, tamamlanana kadar yoklayın ve puanlanan sonuçları alın.
Bulut değerlendirme sonuçları Dökümhane projenizde depolanır. Bunları SDK aracılığıyla alabilir, portalda gözden geçirebilir veya bağlı olduğunda Application Insights'a yönlendirebilirsiniz.
Değerlendiricileri seçme
Değerlendiriciler, sütun eşlemeleri aracılığıyla verilerinizdeki alanlara bağlanır. Veri kümesi iş akışları öğe alanlarını kullanıma sunarken, hedef tarafından oluşturulan iş akışları örnek şema aracılığıyla model veya aracı çıkışını da kullanıma sunar.
Test ölçütlerini yapılandırmadan önce yerleşik değerlendiricileri ve özel değerlendiricileri gözden geçirin.
Başlangıç noktanızı seçin
| Başlangıç noktası | İş akışı |
|---|---|
| Sorgu ve yanıt içeren JSONL veya CSV test verileriniz var. | Buluttaki veri kümelerini değerlendirme |
| Sorgularınız var ve bir modelin veya aracının yanıt oluşturmasını istiyorsunuz. | Buluttaki modelleri ve aracıları değerlendirme |
| Application Insights izleme kayıtlarıyla bir model veya aracı dağıttınız. | Dağıtılan aracı ve model etkileşimlerini değerlendirme |
| Eksiksiz konuşma verilerine veya üretim ortamı konuşma izlerine sahipsiniz. | Buluttaki konuşmaları değerlendirme |
| Yapay sorgulara veya sanal konuşmalara ihtiyacınız vardır. | Yapay veri oluşturma |
| Çalıştırmayı yoklamanız, yorumlamanız, iptal etmeniz veya sorun gidermeniz gerekir. | Bulut değerlendirme sonuçlarını alma |
Saldırgan güvenlik testi için yapay zeka kırmızı ekip oluşturma özelliğini kullanın. Tek başına veri kümesi oluşturmak için bkz. Yapay değerlendirme veri kümesi oluşturma.