Microsoft Foundry'de yönetilen işlem (Önizleme)

Note

Foundry'deki yönetilen bilgi işlem şu anda önizleme sürümündedir. Bu önizleme, hizmet düzeyi sözleşmesi olmadan sağlanır ve üretim iş yükleri için önerilmez. Bazı özellikler desteklenmeyebilir veya kısıtlı özelliklere sahip olabilir. Daha fazla bilgi için bkz. Microsoft Azure Önizlemeleri için Ek Kullanım Koşulları.

Yönetilen işlem (önizleme), Microsoft Foundry'de sanal makineler sağlamanıza, Kubernetes kümesi çalıştırmanıza, kapsayıcı görüntüleri oluşturmanıza veya model sunma çalışma zamanına sahip olmanıza gerek kalmadan ayrılmış GPU kapasitesinde açık kaynak modelleri barındıran bir dağıtım türüdür. Microsoft GPU topolojisinin, çalışma zamanının, kapsayıcı görüntüsünün ve güvenlik düzeltme ekinin sahibidir. İş yükünüz için uygun modeli, dağıtım şablonunu, hızlandırıcı ailesini ve ölçeklendirme davranışını seçersiniz.

Yönetilen bilgi işlem, Foundry'deki diğer tüm dağıtım türleriyle aynı Foundry kaynağını, projeyi, uç noktayı, kimlik doğrulamayı, ağ yapılandırmasını, SDK'ları, gözlemlenebilirliği ve faturalama altyapısını kullanır. Yönetilen işlem içeren bir modeli dağıttığınızda, uygulama kodunuz diğer Dökümhane modelleriyle aynıdır; yalnızca dağıtım adı değişir.

Bu makalede Foundry'de yönetilen işlem dağıtım türü, üzerinde çalıştığınız kavramlar (model örnekleri, dağıtım şablonları, hızlandırıcı aileleri, çalışma zamanları), dağıtabileceğiniz katalog, çıkarım uç noktaları, ölçeklendirme, faturalama ve kota, erişim denetimi ve geçerli sınırlamalar açıklanmaktadır. Adım adım dağıtım yönergeleri için bkz. Yönetilen işlemle açık kaynak modelleri dağıtma.

Foundry içinde yönetilen işlem altyapısının yeri

Dökümhane üç dağıtım türü sunar. Yönetilen işlem, ayrılmış GPU kapasitesindeki açık kaynak modelleri için kullanılacak dağıtım türüdür.

Dağıtım türü Neleri sağlar? Billing En iyi kullanım alanları
Standart token başına ödeme Azure tarafından satılan Foundry modelleri Giriş ve çıkış belirteci başına Başlamak için en düşük sürtünmeli yol; kapasite planlaması olmayan barındırılan modellerde ani trafik.
Sağlanan aktarım hızı Azure tarafından satılan Foundry Modelleri Ayrılmış aktarım hızı birimleri Azure tarafından sunulan belirli Foundry Modellerinde tutarlı gecikme süresiyle tahmin edilebilir, sürekli yük.
Yönetilen bilgi işlem Foundry kataloğundaki açık kaynak ve topluluk modelleri Hızlandırıcı ailesi başına saatlik ücret Foundry tarafından yönetilen çalışma zamanları, özel ağ iletişimi ve diğer dağıtım türlerinde kullanılanlarla aynı SDK'larla, adanmış GPU'larda açık kaynak modelleri barındırma.

Üç dağıtım türü de tek bir Foundry uç noktasını, aynı kimlik doğrulama desenlerini (Microsoft Entra ID ve anahtarı), aynı SDK'ları, aynı gözlemlenebilirlik yüzeyini ve tek bir faturayı paylaşır. Tek bir Foundry projesindeki üç dağıtım türünü de karıştırabilir ve bunları aynı istemci kodundan çağırabilirsiniz.

Temel kavramlar

Bu bölüm, Foundry'de yönetilen işlem dağıtımı kullanmadan önce anlaşılması gereken temel kavramları kapsar.

Model örneği

Model örneği, yönetilen işlemdeki dağıtım birimidir. Sanal makine SKU'su seçmez veya bir düğümü boyutlandırmazsınız; bunun yerine, iş yükünü model terimleriyle açıklarsınız ve Foundry altındaki GPU topolojisini seçer. Örnek, seçtiğiniz modele ve dağıtım şablonuna bağlı olarak bir veya birkaç hızlandırıcı kullanabilir. Model örneklerinin sayısını (dağıtım SKU'sunun capacity değeri) değiştirerek dağıtımı ölçeklendirirsiniz.

Dağıtım şablonu

Dağıtım şablonu, belirli bir modelin nasıl çalışması gerektiğini kodlayan adlandırılmış, sürümlenmiş bir varlıktır. Bir şablon iğneler:

  • Sunum çalışma zamanı (örneğin, vLLM veya SGLang).
  • Hızlandırıcı ailesi ve örnek başına sayı (örneğin, bir H100 80 GB veya iki A100 80 GB).
  • Desteklenen bağlam uzunluğu ve tüm niceleme seçenekleri.
  • Araç çağrısı ve mantık ayrıştırıcıları, puanlama yolu, sistem durumu yoklamaları, istek eşzamanlılığı ve modele özgü bağlam uzantısı ayarları gibi çalışma zamanına özgü ayarlama.

Bir dağıtımı betikle tanımladığınızda, şablon kimliğini belirtirsiniz ve geri kalanını Foundry halleder. Katalogdaki her model genellikle hızlandırıcı ailesi, bağlam uzunluğu ve gecikme süresi ile aktarım hızı arasında denge sağlayan çeşitli şablonlarla birlikte sunulur. Örneğin, qwen3-32b model dört şablonu yan yana kullanıma sunar:

Template Runtime Hızlandırıcı Bağlam
qwen--qwen3-32b--40k-nvidia-a100 vLLM 1 × A100 80 GB 40 K
qwen--qwen3-32b--40k-nvidia-h100 vLLM 1 × H100 80 GB 40 K
qwen--qwen3-32b--128k-nvidia-2xa100 vLLM 2 × A100 80 GB 128 K
qwen--qwen3-32b--128k-nvidia-2xh100 vLLM 2 × H100 80 GB 128 K

Şablon seçmek, modelin çalışma şekline göre değiştirdiğiniz tek düğmedir.

Hızlandırıcı aileleri

Yönetilen işlem dağıtımları belirli bir sanal makine SKU'su değil hızlandırıcı ailesini hedefler. Desteklenen aileler şunlardır:

  • NVIDIA A100 80 GB (A100_80GB)
  • NVIDIA H100 80 GB (H100_80GB)
  • AMD MI300X 192 GB (MI_300_192GB)

Bölge başına hızlandırıcı ailesi başına kota verilir.

Model çalışma zamanları

Yönetilen işlem altyapısı, her modeli Microsoft tarafından oluşturulan, taranan, imzalanan ve yamalanan bir çıkarım çalışma zamanında çalıştırır. Kapsayıcıları çalıştırmaz veya yeniden oluşturmazsınız. Model mimarisine göre çalışma zamanı portföyü seçilir:

Runtime İçin kullanın Notlar
vLLM Yüksek aktarım hızına sahip LLM hizmeti Sürekli batch işleme, PagedAttention, tensor paralelliği, LoRA sıcak değişimi. Çoğu büyük dil modeli için varsayılandır.
SGLang Yapılandırılmış çıkış LLM hizmeti Ajan tabanlı ve araç kullanan iş yükleri için JSON, regex ve dil bilgisiyle kısıtlanmış üretim.
TensorRT-LLM NVIDIA için iyileştirilmiş LLM hizmeti TRT-LLM’nin gecikme süresi veya iş hacmi açısından üstün geldiği model aileleri için düşük gecikmeli NVIDIA çıkarımı.
NVIDIA NIM NVIDIA Çıkarım Mikro Hizmetleri NVIDIA tarafından yayımlanan modeller için NIM API uyumluluğuna sahip TensorRT-LLM arka ucu.
Metin Gömme Çıkarımı (TEI) Eklemeler, yeniden boyutlandırmalar, sınıflandırıcılar Sık erişimli yolları eklemek ve almak için hızlandırıcıya özgü çekirdekler.
llama.cpp CPU ve küçük GPU'larda sunum Aynı OpenAI uyumlu API’nin arkasındaki GGUF ile kuantize edilmiş modeller.
hf-serve Görüntü, ses, segmentasyon, diğer Transformers-native işlem hatları LLM dışındaki modaliteler için Face'in çok modelli sunucusunu kucaklama ve hızlı yollar ekleme.

Aktif müşteri dağıtımlarına çalışma zamanı güncellemeleri ve CVE yamaları otomatik olarak uygulanır. Çalışma zamanı güncelleştirmesini almak için modelinizi yeniden dağıtmazsınız.

Desteklenen modeller

Foundry'de, Foundry model kataloğunda yer alan ve kayıt defterinden sunulan azure-huggingface modellerini dağıtıma almak için yönetilen işlem gücünü kullanabilirsiniz. Bu modeller aşağıdaki özniteliklere sahiptir:

  • Özenle seçilir ve haftalık olarak yenilenir. Hugging Face ekosistemindeki öne çıkan modeller, topluluk tarafından yayımlandıkça sürekli olarak eklenmektedir. Katalog metin, görüntü işleme, ses ve çok modüllü modeller (sohbet ve aracılar için LLM'ler ve görüntü dili modelleri), otomatik konuşma tanıma (ASR), konuşma çevirisi, eklemeler, segmentasyon ve görüntü oluşturma konularını kapsıyor.
  • Yalnızca SafeTensors, güvenilmeyen kod yok. Koleksiyondaki her model görüntülenir. Yük zamanında üçüncü taraf Python yürütülmesini gerektirecek depolar (trust_remote_code desenleri) düzeltilir veya dışlanır.
  • Önceden hazırlanmış ağırlıklar. Model ağırlıkları Hugging Face’ten bir kez çekilir, doğrulanır ve modelin sunulduğu bölgelerde Microsoft tarafından yönetilen Azure depolamasında saklanır. Kapsayıcı görüntüleri, Microsoft tarafından yönetilen bir kayıtta barındırılır. Sonuç olarak, yönetilen bilgi işlem dağıtımlarının Hugging Face Hub'a giden ağ erişimine ihtiyacı yoktur — çıkış trafiği olmadan tamamen özel bir ağa dağıtım yapabilirsiniz.
  • Lisans meta verileri korunur. Her katalog model kartı, kaynak lisansı kaydeder ve gösterir. Microsoft kurumsal dağıtım ilkesine yönelik lisans gözden geçirmesi, kürasyon sırasında gerçekleşir.

Model oluşturma işlem hattı

Hugging Face koleksiyonundaki her model, katalogda yer almadan önce beş aşamalı bir kürasyon sürecinden geçer:

  1. Eğilimli modelleri tanımlama: Microsoft topluluk sinyallerine, iş ortağı isteklerine ve müşteri talebine göre popüler modelleri tanımlar.
  2. Uyumluluk ve güvenlik ekranı: Her model, desenler ve özel yürütülebilir kod için trust_remote_code lisans gözden geçirme ve incelemeden geçer.
  3. Çalışma zamanı kapsayıcı görüntülerini derleyin, tarayın ve yayımlayın: Microsoft tarafından derlenir, CVE'ler için taranır, imzalanır ve Microsoft yönetilen bir kayıt defterinde yayımlanır.
  4. Güvenli Azure depolamasına ağırlıkları yükleyin: Model kartına göre doğrulanır ve modelin sunulduğu bölgelerde depolanır.
  5. Doğrulama ve yayımlama: Her model, çalışma zamanı ve hızlandırıcı bileşimi API uyumluluğu ve performansı için test edilir, ardından tek tıklamayla dağıtım yolu ile kataloğa yayımlanır.

Çıkarım uç noktaları

Bir modelin yönetilen işlem altyapısına dağıtılması, modeli, belirteç başına ödeme ve sağlanan işlem hacmi dağıtımlarında kullanılan aynı birleşik Foundry proje uç noktasında çıkarım için kullanılabilir hale getirir. Temel uç nokta düzenine https://<account>.services.ai.azure.comsahiptir.

Uç nokta rotaları

Yönetilen bir hesaplama dağıtımı, birleşik uç noktada iki rota ailesi üzerinden çağrılabilir. Seçtiğiniz yol, temel alınan modelin ve çalışma zamanının OpenAI uyumlu bir API'yi kullanıma sunup sunmadığına bağlıdır.

Güzergâh Yol Şunlar için geçerlidir: Davranış
Yönetilen dağıtım rotası (OSS) <endpoint>/managed-deployments/<deployment-name>/ Tüm yönetilen işlem dağıtımları Yönetilen bilgi işlem üzerinde dağıtılmış tüm modellerle, kendi SDK’sıyla birlikte sunulan özel modeller de dahil, çalışır. /chat/completions sunan modeller, istemcinin base_url öğesini bu yola yönlendirerek OpenAI SDK’sı kullanılarak bu rota üzerinden de çağrılabilir.
OpenAI uyumlu yol <endpoint>/openai/v1/ Çalışma zamanı OpenAI ile uyumlu bir API sunan yönetilen bilgi işlem dağıtımları (örneğin, vLLM, SGLang, TensorRT-LLM, sohbet ya da gömme sunumu için llama.cpp) OpenAI SDK, base_url öğesini bu yola ayarlayıp istek yükünün alanına dağıtım model ileterek dağıtımı çağırabilir. Bir istek, temelindeki modelin veya çalışma zamanının OpenAI ile uyumlu arabirimi desteklemediği bir dağıtım adıyla bu rotayı hedefliyorsa, çalışma zamanı HTTP 404 döndürür.

Önemli çıkarımlar:

  • Her yönetilen işlem dağıtımına https://<account>.services.ai.azure.com/managed-deployments/<deployment-name>/ yolu üzerinden erişilebilir
  • Çalışma zamanı OpenAI ile uyumlu olan herhangi bir dağıtıma yolu üzerinden https://<account>.services.ai.azure.com/openai/v1/ erişilebilir.
  • İstemci kodunu diğer Dökümhane dağıtımlarıyla paylaşmak istediğinizde OpenAI yolunu kullanın.
  • Özel bir SDK veya OpenAI dışı bir API ile gelen modeller için managed-deployments rotasını kullanın.

Tip

Yönetilen bir chat-completions işlem dağıtımı, bir Foundry Agent’a yöneticiye bağlı bir model olarak da eklenebilir ve diğer tüm Foundry modelleriyle aynı kimlik doğrulama, uç nokta ve gözlemlenebilirlik kullanılarak, aynı OpenAI SDK’sı ile Foundry Responses API üzerinden çağrılabilir.

Uç nokta kimlik doğrulaması

Yönetilen işlem dağıtımları, Foundry uç noktasının geri kalanıyla aynı kimlik doğrulama desenlerini kullanır:

  • Microsoft Entra ID (önerilir). https://ai.azure.com/.default kapsamı için bir belirteç alın ve bunu Authorization üst bilgisinde Bearer belirteci olarak iletin. Entra ID ile yönetilen işlem dağıtımına çağrı yapmak için, çağrıyı yapan kimliğin Foundry hesabı kapsamında Foundry User rolüne sahip olması gerekir. Token tabanlı moddaki OpenAI SDK’sı ve DefaultAzureCredential, yönetilen hesaplamaya özgü herhangi bir yapılandırma olmadan çalışır.
  • Hesap API'si anahtarı. Foundry hesap anahtarını Authorization: Bearer <key> olarak geçirin. Bağımsız değişkeni ayarladığınızda OpenAI SDK'sı api_key anahtarı bu formda otomatik olarak gönderir. Anahtarlar, yönetilen işlem dağıtımlarında belirteç başına ödeme ve aynı hesap üzerindeki PTU dağıtımlarında olduğu gibi aynı erişimi verir.

Her iki kimlik doğrulama seçeneği de her iki uç nokta yolunda da çalışır. Uçtan uca istemci kodu örnekleri (Entra ID veya API anahtarıyla OpenAI SDK'sı) için bkz. Test isteği gönderme.

Scaling

Model örneklerinin sayısını değiştirerek yönetilen işlem dağıtımını ölçeklendirirsiniz. Dağıtım SKU'sunun capacity değerini ayarladığınızda, Foundry GPU sayısını buna göre ayarlar. Toplam GPU sayısı, seçtiğiniz dağıtım şablonu tarafından tanımlanan örnek başına GPU sayısıyla çarpılan model örneği sayısına eşittir. Foundry sizden bir düğüm boyutu belirlemenizi veya bir VM ailesi seçmenizi istemez.

Faturalama, kota ve dağıtım kapsamları

Yönetilen bilgi işlem, hızlandırıcı başına saatlik ücretlendirilir. Tüm GPU sunucularını kiraladığınız ve modelinizin kullanıp kullanmadığına bakılmaksızın kutudaki her GPU için ödeme yaptığınız VM tabanlı altyapıdan farklı olarak, model örnekleri için yönetilen işlem ücretleri. Dökümhane, her modeli gerçekten ihtiyaç duyduğu GPU sayısına (bir, iki, dört veya sekiz) göre boyutlandırır, bu nedenle iş yükünüzün yanında duran boşta hızlandırıcılar için ödeme yapmayız. Dağıtımın maliyeti:

Model örneği başına hızlandırıcı sayısı × model örneği sayısı × çalıştırılan saat × saatlik ücret

Saatlik ücretler hızlandırıcı ailesine (A100, H100, MI300X) ve dağıtım kapsamına göre farklılık gösterir. Geçerli fiyatlandırma için bkz. Azure fiyatlandırma hesaplayıcısı.

Dağıtım kapsamı

Yönetilen bilgi işlem (önizleme) şu anda dağıtım SKU adı aracılığıyla ayarlanan GlobalManagedCompute dağıtımını destekler. Genel dağıtım size en geniş hızlandırıcı kapasitesini en düşük oranda verir.

Quota

Yönetilen işlem gücü kotası, Foundry kota süreci aracılığıyla her bölgedeki her hızlandırıcı ailesi için verilir. Yönetilen işlem kotası, Azure VM kotasından ayrıdır. Azure VM kotası, belirli bölgesel VM SKU’larına bağlı bir hizmet olarak altyapı (IaaS) tahsisi iken, yönetilen işlem kaynakları yönetilen bir PaaS sunumudur. Mevcut Azure VM kotası yönetilen işlem dağıtımına uygulanamaz.

Kullanımı görüntüleme, maliyeti bir projeye atfetme ve kota talep etme hakkında ayrıntılı bilgi için Microsoft Foundry için maliyetleri planlama ve yönetme ve Kotaları yönetme ve artırma konularına bakın.

Erişim denetimi

Yönetilen işlem, Foundry'nin rol tabanlı erişim denetimi (RBAC) modelini kullanır. Yönetilen bilgi işlem dağıtımını oluşturmak, okumak, güncelleştirmek ve silmek için gereken Azure kaynak sağlayıcısı işlemleri kümesi, her bir işlemi sağlayan yerleşik rollerle birlikte Microsoft Foundry için rol tabanlı erişim denetimi — yönetilen bilgi işlem denetim düzlemi işlemleri belgesinde açıklanmıştır.

Bir bakışta:

  • Bilişsel Hizmetler Katkıda Bulunanı (veya Döküm Sahibi / Döküm Hesabı Sahibi), yönetilen işlem dağıtımlarında tam oluşturma / okuma / güncelleştirme / silme izni verir.
  • Bilişsel Hizmetler Kullanıcısı ve Foundry Kullanıcısı dağıtımlara salt okunur erişim izni verir.
  • Foundry Project Manager, dağıtımlara ve hızlandırıcı kullanım verilerine okuma erişimi sağlar, ancak oluşturma veya silme izni vermez.

Birleşik Foundry uç noktasındaki çıkarım (veri düzlemi), Microsoft Entra ID ile dağıtımları çağırabilmek için Foundry hesabı kapsamı düzeyinde Foundry User atanmasıyla standart Foundry modelini takip eder.

Limitations

Yönetilen işlem genel önizleme aşamasındadır. Üretim iş yüklerini dağıtmadan önce aşağıdakilere dikkat edin:

  • İçerik filtreleme: Yerleşik Azure Yapay Zeka İçerik Güvenliği filtreleri, genel önizleme kapsamında, yönetilen işlem veri akışının bir parçası değildir. İstek düzeyi veya yanıt düzeyi filtrelemeye ihtiyacınız varsa Azure Yapay Zeka İçerik Güvenliği API'lerini doğrudan uygulamanızdan çağırın.
  • Bölge kullanılabilirliği: Yönetilen bilgi işlem, Global kapsamla kullanıma sunulur. Data Zone dağıtımları ve ek bölgeler kademeli olarak kullanıma sunuluyor — güncel kapsam için genel kullanılabilirlik matrisine bakın.
  • Fiyatlandırma: Önizleme aşamasındaki yönetilen işlem dağıtımı için hızlandırıcı ailesine ve bölgeye göre saatlik ücretler, rezerve kapasite ve taahhüt indirimleri değişmektedir. Geçerli fiyatlar için bkz. Azure fiyatlandırma hesaplayıcısı.