Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Note
Foundry'deki yönetilen bilgi işlem şu anda önizleme sürümündedir. Bu önizleme, hizmet düzeyi sözleşmesi olmadan sağlanır ve üretim iş yükleri için önerilmez. Bazı özellikler desteklenmeyebilir veya kısıtlı özelliklere sahip olabilir. Daha fazla bilgi için bkz. Microsoft Azure Önizlemeleri için Ek Kullanım Koşulları.
Microsoft Foundry'de yönetilen işlem dağıtımı (önizleme), ayrılmış GPU kapasitesinde açık kaynak modelleri barındırıyor. Microsoft GPU topolojisinin, çalışma zamanının, kapsayıcı görüntüsünün ve güvenlik düzeltme ekinin sahibidir. İş yükünüz için uygun modeli, dağıtım şablonunu, hızlandırıcı ailesini ve ölçeklendirme davranışını seçersiniz. Bu makalede, Microsoft Foundry'de yönetilen işlem üzerine açık kaynak modeli dağıtmaya yönelik uçtan uca iş akışında yol gösterilmektedir.
Bu makalede şunların nasıl yapılacağını öğreneceksiniz:
- Model kataloğunda model seçme
- Dağıtım şablonu seçme
- Foundry portalını veya Python SDK'sını kullanarak modeli dağıtma
- OpenAI SDK'sını kullanarak çıkarım gerçekleştirme
- Dağıtımı ölçeklendirme ve izleme
- Daha fazla kota isteme
Model örnekleri, dağıtım şablonları, çalışma zamanları, hızlandırıcı aileleri, faturalama ve geçerli sınırlamalar dahil olmak üzere Foundry'de yönetilen işlem dağıtımına genel bakış için bkz. Microsoft Foundry'de (Önizleme)
Prerequisites
Etkin bir Azure aboneliği. Bir hesap oluşturmak için bkz. Azure ücretsiz hesabınızı oluşturma.
Abonelikte kaynak oluşturma izniniz olan bir kaynak grubu.
Bir Microsoft Foundry hesabı (
AIServicestüründe bir Bilişsel Hizmetler hesabı) ve bir Foundry projesi. Bir tane oluşturmak için Foundry projesi oluşturma bölümüne bakın.Aşağıdakiler, Foundry hesabı kapsamındaki Azure rol atamalarıdır:
- Cognitive Services Contributor (veya Foundry Owner / Foundry Account Owner) — yönetilen bilgi işlem dağıtımlarını oluşturmak, güncelleştirmek ve silmek için gereklidir. Bkz. Microsoft Foundry için Rol tabanlı erişim denetimi — yönetilen işlem denetim düzlemi işlemleri.
- Foundry User — Playground, SDK veya REST'ten Microsoft Entra ID ile dağıtımı çağırmak için gereklidir.
Hedef bölgede (A100, H100 veya MI300X) dağıtmayı planladığınız hızlandırıcı ailesi için yönetilen işlem kotası onaylandı. Yönetilen işlem kotası, Azure VM kotasından ayrıdır. Bu makalenin sonunda daha fazla kota isteme konusuna bakın.
SDK ve CLI örnekleri için yerel araçlar:
pip install "azure-mgmt-cognitiveservices==15.0.0b2" azure-identity openai requests az loginAzure CLI 2.60 veya üzeri.
Important
Foundry'de yönetilen işlem genel önizleme aşamasındadır. API'ler, SKU adları ve desteklenen bölgeler genel kullanılabilirlik öncesinde değişebilir. Yerleşik içerik filtreleme, genel önizlemede yönetilen işlem veri yolunun bir parçası değildir. İstek düzeyi veya yanıt düzeyi filtrelemeye ihtiyacınız varsa Azure Yapay Zeka İçerik Güvenliği API'lerini doğrudan uygulamanızdan çağırın.
Katalogda model seçme
Yönetilen bilgi işlem, Foundry model kataloğunda yer alan Hugging Face Collection içindeki modelleri, azure-huggingface kayıt defterinden sunarak dağıtıma alır.
-
Microsoft Foundry'ye giriş yapın.
Yeni Dökümhane seçeneğinin açık olduğundan emin olun. Bu adımlar Foundry (yeni) için geçerlidir.
- Aboneliğinizi ve Foundry kaynağınızı seçin.
- Sağ üst gezinti bölmesinde Derle'yi ve ardından sol bölmede Modeller'i seçin.
- Kataloğu Koleksiyonlar'a göre filtreleyin. Yüzü Kucaklama'yı seçin. Dağıtmak istediğiniz modeli daraltmak (örneğin, Qwen gibi bir model ailesi seçmek) veya modalite veya göreve göre daraltmak için diğer filtrelerden herhangi birini de kullanabilirsiniz. Model adına göre de arama yapabilirsiniz.
- Ayrıntılarını açmak için bir model kartı (örneğin,
nvidia-nemotron-3-nano-30b-a3b-fp8) seçin.
Model kartı, üst kaynak lisansını, modaliteyi, desteklenen görevleri ve model için yayımlanan dağıtım şablonlarını gösterir. Portal sihirbazını kullanmak yerine Python SDK veya REST aracılığıyla dağıtmayı planlıyorsanız dağıtım çağrısına giriş olarak üç değere ihtiyacınız olacaktır. Bu değerleri Dökümhane portalında aşağıdaki gibi bulabilirsiniz:
Model Kimliği: model için tam nitelikli kayıt varlığı kimliği. Katalogdaki model kartında kullanılabilir (model ayrıntıları bölmesinden kopyalayın). Örnek:
azureml://registries/azure-huggingface/models/nvidia--nvidia-nemotron-3-nano-30b-a3b-fp8/versions/2Dağıtım şablonu kimliği: Model için çalışma zamanını, hızlandırıcı ailesini ve sayısını ve bağlam uzunluğunu tanımlar. Model kartında Dağıt'ı seçtiğinizde açılan dağıtım sihirbazında kullanılabilir. Bir şablon seçin ve sihirbazdan Dağıtım şablonu kimliğini kopyalayın. Örnek:
azureml://registries/azure-huggingface/deploymenttemplates/nvidia--nvidia-nemotron-3-nano-30b-a3b-fp8--nvidia-h100/labels/latestNote
Model kimliği ve dağıtım şablonu kimliği uyumlu olmalıdır; her şablon, desteklediği model sürümlerini listeler. Portal sihirbazı yalnızca seçtiğiniz model için uyumlu şablonları gösterir. Kod kullanarak dağıtım yapıyorsanız, her iki başvurunun da
azure-huggingfacekayıt deposundaki geçerli kayıt deposu varlıklarına çözümlendiğini doğrulayın.Dağıtım şablonları hakkında daha fazla bilgi edinmek için Yönetilen işleme genel bakış makalesindeki Dağıtım şablonuna bakın.
Hızlandırıcı türü: örneğin
H100_80GB,A100_80GB, veyaMI_300_192GB. Dağıtım sihirbazında her şablonun yanında gösterilir.
Modeli kullanıma alma
Dağıtım sihirbazını açmak için model kartında Dağıt'ı seçin.
Dağıtım adı belirtin. Dağıtım adı, uygulamanızın çıkarım sırasında
modelalanına ilettiği addır; kararlı ve uygulamanız için uygun bir ad seçin (örneğin,nemotron-3-nano-30b).Dağıtım türü (Genel Yönetilen İşlem) dağıtım sihirbazında önceden seçilmiştir.
İş yükünüzle eşleşen Dağıtım şablonunu seçin. Örneğin, orta düzeyde bağlam uzunluğunda en düşük maliyet için H100 tek hızlandırıcılı şablon veya istemleriniz tek hızlandırıcı bağlam sınırını aşarsa iki hızlandırıcılı bir şablon.
Hızlandırıcı türünü (örn.
H100_80GB) seçin.Model örneklerini
1olarak ayarlayın (veya iş yükünüzü ölçtüyseniz daha yüksek). Model örnekleri, yönetilen işlem kaynağını boyutlandırır ve dağıtım SKU'sundakicapacitydeğeridir. Her örnek, şablon tarafından tanımlanan hızlandırıcı sayısını kullanır; örneğin, 2 kapasitesine sahip örnek başına bir H100 belirten bir şablonda toplamda iki H100 hızlandırıcısı kullanılır.Tip
capacity: 1İlk dağıtımla başlayın, ardından iş yükünüzü ölçtükten sonra kapasiteyi artırarak ölçeği genişletin. Kapasiteyi artırma hakkında bilgi için bkz. Dağıtımı yönetme ve ölçeklendirme .Dağıtım maliyetini onaylamak için onay kutusunu seçin.
Dağıt'ı seçin. Sağlama işlemi genellikle 10-15 dakika sürer.
Dağıtımı doğrulayın.
Dağıtım ayrıntıları sayfası, model Foundry uç noktasının arkasında canlıya alındığında Creating konumundan Succeeded konumuna güncellenir. Dağıtım hakkında sağlama durumu, dağıtım türü ve dağıtımı oluştururken yaptığınız diğer seçimler dahil olmak üzere ayrıntıları görebilirsiniz.
Test isteği gönderme
Dağıtım hazır olduğunda, Foundry Playground'da etkileşimli olarak test edin.
- Dağıtım Ayrıntıları sayfasından bu sekmeye geçmek için Oyun Alanı sekmesini seçin.
- Dağıtımı test etmek için bir istem gönderin.
Dağıtımı izleme
Yönetilen işlem dağıtımları, diğer Foundry dağıtımlarıyla aynı Azure İzleyici platformunda ölçümler yayımlar. Dökümhane portalındaki dağıtım ayrıntıları sayfasında İzleyici sekmesi şunları gösterir:
- HTTP durum koduna göre gruplandırılmış istek sayısı.
- Yanıt süresi yüzdebirlik dilimleri (p50, p90, p99).
- Sohbet tamamlama modelleri için: giriş ve çıkış belirteç sayıları, ilk belirtece kadar geçen süre (TTFT) yüzdelikleri ve belirteçler arası kod çözme süreleri yüzdelikleri.
Daha ayrıntılı analiz veya uyarı oluşturma için dağıtımı Azure portalında açın ve aynı ölçümleri grafikte görüntülemek, dağıtıma göre gruplandırmak ve uyarılar yapılandırmak için Monitoring altındaki Metrics seçeneğini kullanın. Dağıtım başına faturalama etiketleri otomatik olarak oluşturulur. Maliyet Yönetimi'ni dağıtım etiketine göre filtreleyerek harcamayı belirli bir yönetilen işlem dağıtımıyla ilişkilendirin. Ayrıntılar için bkz. Microsoft Foundry için maliyetleri planlama ve yönetme.
Dağıtımı sil
Bir dağıtımın silinmesi, hızlandırıcı tahsisini boşa çıkarır ve faturalandırmayı hemen durdurur. Dağıtımı silmek için:
- Dökümhane portalında dağıtım listesine gidin.
- Dağıtım adınızın yanındaki radyo düğmesini seçin.
- Sağ bölmede Sil'i seçin.
Daha fazla kota isteme
Yönetilen işlem kotası, Foundry kota süreci aracılığıyla her bölgedeki her hızlandırıcı ailesi için verilir ve Azure VM kotasından ayrıdır. Mevcut Azure VM kotası yönetilen işlem dağıtımına uygulanamaz.
Daha fazla kota istemek için:
- Sağ üst gezinti bölmesinde çalıştır'ı ve ardından sol bölmede Kota'yı seçin.
- Yönetilen işlem sekmesini seçin. Tabloda, hızlandırıcı ailesine ve bölgesine göre gruplandırılmış geçerli ayırmalar listelenir.
- Sağ üst köşedeki İstek kotası'nı seçin.
- İstek formunda hızlandırıcı ailesini (A100, H100 veya MI300X), hedef bölgeyi ve istenen kotayı seçin. İsteği gönderin.
Onaylanan kota değişikliğinin yayılması için 15 dakikaya kadar izin verin. Güncelleştirilmiş ayırmayı doğrulamak için Kota sayfasını yenileyin. Kota kavramları hakkında daha fazla bilgi için bkz. Kaynaklar için kotaları yönetme ve artırma.
Modeli dağıtmak için aşağıdaki Python betiğini kullanın. Yer tutucuları kendi abonelik kimliğiniz, kaynak grubunuz, Foundry hesap adınız ve dağıtım adınızla değiştirin.
Tip
capacity: 1 İlk dağıtımla başlayın, ardından iş yükünüzü ölçtükten sonra kapasiteyi artırarak ölçeği genişletin. Kapasiteyi artırma hakkında bilgi için bkz. Dağıtımı yönetme ve ölçeklendirme .
from azure.identity import DefaultAzureCredential
from azure.mgmt.cognitiveservices import CognitiveServicesManagementClient
SUBSCRIPTION_ID = "<your-subscription-id>"
RESOURCE_GROUP = "<your-resource-group>"
ACCOUNT_NAME = "<your-foundry-account>"
DEPLOYMENT_NAME = "nemotron-3-nano-30b"
MODEL = "azureml://registries/azure-huggingface/models/nvidia--nvidia-nemotron-3-nano-30b-a3b-fp8/versions/2"
TEMPLATE = "azureml://registries/azure-huggingface/deploymenttemplates/nvidia--nvidia-nemotron-3-nano-30b-a3b-fp8--nvidia-h100/labels/latest"
client = CognitiveServicesManagementClient(
DefaultAzureCredential(), SUBSCRIPTION_ID
)
deployment = client.managed_compute_deployments.begin_create_or_update(
resource_group_name=RESOURCE_GROUP,
account_name=ACCOUNT_NAME,
deployment_name=DEPLOYMENT_NAME,
resource={
"sku": {"name": "GlobalManagedCompute", "capacity": 1},
"properties": {
"model": MODEL,
"deploymentTemplate": TEMPLATE,
"acceleratorType": "H100_80GB",
"versionUpgradeOption": "OnceNewDefaultVersionAvailable",
},
},
).result() # blocks until terminal state (~10–15 min)
print(f"State: {deployment.properties.provisioning_state}")
print(f"ID: {deployment.id}")
Dağıtımı doğrulayın.
Dağıtım oluşturulduktan sonra, trafik göndermeden önce iyi durumda olduğunu onaylayın.
d = client.managed_compute_deployments.get(
resource_group_name=RESOURCE_GROUP,
account_name=ACCOUNT_NAME,
deployment_name=DEPLOYMENT_NAME,
)
print(f"State: {d.properties.provisioning_state}") # expect: Succeeded
print(f"Model: {d.properties.model}")
print(f"Template: {d.properties.deployment_template}")
print(f"Accelerator: {d.properties.accelerator_type}")
print(f"Capacity: {d.sku.capacity}")
Şunu arayın:
-
provisioningState: Succeededdağıtımın canlı olduğu anlamına gelir. -
acceleratorTypeistediğiniz değerle eşleşir. -
sku.capacity, istediğiniz örnek sayısıyla eşleşir.
provisioningState
Failed ise, Sorun Giderme bölümüne bkz.
Test isteği gönderme
Yönetilen işlem dağıtımlarına şu konumdaki birleşik Foundry uç noktası üzerinden erişilebilir:
https://<account>.services.ai.azure.com/openai/v1/
model İstek gövdesindeki alan, model kimliğini değil belirttiğiniz dağıtım adını alır.
from azure.identity import DefaultAzureCredential, get_bearer_token_provider
from openai import OpenAI
ACCOUNT_NAME = "<your-foundry-account>"
DEPLOYMENT_NAME = "nemotron-3-nano-30b"
token_provider = get_bearer_token_provider(
DefaultAzureCredential(),
"https://cognitiveservices.azure.com/.default",
)
client = OpenAI(
base_url=f"https://{ACCOUNT_NAME}.services.ai.azure.com/openai/v1",
api_key="placeholder", # required by OpenAI SDK; overridden by Authorization header
default_headers={"Authorization": f"Bearer {token_provider()}"},
)
resp = client.chat.completions.create(
model=DEPLOYMENT_NAME,
messages=[{"role": "user", "content": "What is the capital of France?"}],
)
print(resp.choices[0].message.content)
dağıtımı Microsoft Entra ID ile çağırmak için Foundry hesabında Azure AI User rolü gerekir.
Dağıtımı yönetme ve ölçeklendirme
Yönetilen işlem dağıtımları model odaklı olduğundan, bir düğümü boyutlandırarak değil model örneklerinin sayısını değiştirerek dağıtımları ölçeklendirirsiniz.
Kapasiteyi değiştirme
d = client.managed_compute_deployments.get(
RESOURCE_GROUP, ACCOUNT_NAME, DEPLOYMENT_NAME
)
d.sku.capacity = 3
client.managed_compute_deployments.begin_create_or_update(
resource_group_name=RESOURCE_GROUP,
account_name=ACCOUNT_NAME,
deployment_name=DEPLOYMENT_NAME,
resource=d,
).result()
Çalışma zamanı ve model güncellemelerini alın
Dağıtımda versionUpgradeOption öğesini OnceNewDefaultVersionAvailable olarak ayarlamak, Microsoft bunları yayımladığında dağıtımın yeni varsayılan model ve çalışma zamanı sürümlerini almasını sağlar. Çalışma zamanı yamaları ve CVE düzeltmeleri, çalışan müşteri dağıtımlarına otomatik olarak uygulanır; bunlardan yararlanmak için modeli yeniden dağıtmanız gerekmez.
Dağıtımı izleme
Yönetilen işlem dağıtımları, diğer Foundry dağıtımlarıyla aynı Azure İzleyici platformunda ölçümler yayımlar. Daha ayrıntılı analiz veya uyarı oluşturmak için dağıtımı Azure portalında açın ve İzleme altındaki Ölçümler bölümünü kullanarak aşağıdakiler gibi ölçümlerin grafiğini oluşturun:
- HTTP durum koduna göre gruplandırılmış istek sayısı.
- Yanıt süresi yüzdebirlik dilimleri (p50, p90, p99).
- Sohbet tamamlama modelleri için: giriş ve çıkış belirteç sayıları, ilk belirtece kadar geçen süre (TTFT) yüzdelikleri ve belirteçler arası kod çözme süreleri yüzdelikleri.
Ayrıca dağıtıma göre gruplandırabilir ve uyarıları yapılandırabilirsiniz. Dağıtım başına faturalama etiketleri otomatik olarak oluşturulur. Maliyet Yönetimi'ni dağıtım etiketine göre filtreleyerek harcamayı belirli bir yönetilen işlem dağıtımıyla ilişkilendirin. Ayrıntılar için bkz. Microsoft Foundry için maliyetleri planlama ve yönetme.
Dağıtımı sil
Bir dağıtımın silinmesi, hızlandırıcı tahsisini boşa çıkarır ve faturalandırmayı hemen durdurur. Dağıtımı silmek için:
client.managed_compute_deployments.begin_delete(
resource_group_name=RESOURCE_GROUP,
account_name=ACCOUNT_NAME,
deployment_name=DEPLOYMENT_NAME,
).result()
Erişim denetimi özeti
| Action | En düşük rol |
|---|---|
| Yönetilen bir işlem konuşlandırması oluşturma, güncelleştirme veya silme | Foundry hesabında Bilişsel Hizmetler Katılımcısı (veya Foundry Sahibi / Foundry Hesabı Sahibi) |
| Bir dağıtımı okuma veya dağıtımları listeleme | Bilişsel Hizmetler Kullanıcısı, Dökümhane Kullanıcısı, Döküm Project Yöneticisi veya yukarıdaki rollerden herhangi biri |
| Microsoft Entra ID kullanarak dağıtımı çağırma | Foundry hesabındaki Foundry kullanıcısı |
| Api anahtarıyla dağıtımı çağırma | Hesap anahtarı (çağrının kendisi için Azure rolü gerekmez; anahtar alma işlemi okuma erişimi gerektirir) |
Azure kaynak sağlayıcısı işlemlerinin tam listesi, rol-izin matrisi ve standart dağıtımlarla karşılaştırma için Microsoft Foundry için Rol tabanlı erişim denetimi — yönetilen işlem denetim düzlemi işlemleri konusuna bakın.
Troubleshooting
provisioningState: Failed
İstenen hızlandırıcı ailesinin hedef bölgede kotayı onayladığını ve seçilen dağıtım şablonunun bu hızlandırıcı ailesini listelediğini onaylayın. Eşleşmeyen model ve dağıtım şablonu, örneğin, farklı bir model sürümü için yayımlanmış bir şablon yaygın bir nedendir. Her iki referansın da azure-huggingface kayıt defterindeki geçerli kayıt defteri varlıklarına çözümlendiğini doğrulayın.
Oluşturma sırasında "Kota aşıldı"
Foundry hesabında, istenen hızlandırıcı ailesi için bölgede yeterli yönetilen işlem kotası bulunmuyor. Daha fazla kota isteyin. Azure VM kotası yönetilen işlem için geçerli değildir.
Bölgede "Yetersiz kapasite"
Bölgede istenen hızlandırıcı ailesi için kapasite bulunamadı. Farklı bir aile deneyin (örneğin, H100 yerine MI300X'te dağıtın), örnek başına daha az hızlandırıcı içeren bir şablon seçin veya farklı bir bölgeyi hedefleyin. MI300X gibi daha büyük bellek aileleri genellikle A100'e sığmayan modeller için kapasiteye sahiptir.
/openai/v1/ rotasından 404
Sohbet tamamlama isteği https://<account>.services.ai.azure.com/openai/v1/chat/completions 404 döndürüyorsa şunları doğrulayın:
- İstek gövdesindeki dağıtım adı, oluşturduğunuz dağıtımla eşleşir.
- Dağıtımın
provisioningStatedeğeriSucceeded. - Model çalışma zamanı sohbet tamamlamalarını sunar. Bazı çalışma zamanları (örneğin, eklemeler için TEI) sohbet tamamlamaları yolunu kullanıma sunmaz; bunun yerine model kartında belgelenen yolu kullanın.
Dağıtım 20 dakikadan uzun süre takılı kaldı Creating
Bazı büyük modellerin ortaya çıkma süresi tipik 10-15 dakikadan daha uzun sürer.
provisioningState 20 dakika sonra hâlâ Creating ise, işlem durumu iletisi olup olmadığını görmek için Foundry portalındaki dağıtım ayrıntıları sayfasını denetleyin ve temel alınan bölgenin durumunun kötüleşmediğini doğrulayın. Dağıtım, herhangi bir işlem mesajı olmadan 30 dakikadan uzun süre Creating durumunda kalırsa onu silin ve yeniden deneyin. Hazırlama işlemi, dağıtım adına göre idempotenttir.