Microsoft Döküm Modelleri için dağıtıma genel bakış

Microsoft Döküm Modelleri, üretken yapay zeka uygulamaları için çok çeşitli yapay zeka modellerini keşfetmeye ve dağıtmaya yönelik merkezdir. Modeli çıkarım istekleri için kullanılabilir hale getirmek için dağıtırsınız. Dökümhane, model türüne ve altyapı gereksinimlerinize bağlı olarak iki dağıtım seçeneği sunar.

Ipucu

Her zaman dağıtım oluşturmanız gerekmez. Anında erişim (önizleme) ile desteklenen modelleri ada göre çağırır ve çıkarım çalıştırmaya hemen başlarsınız; dağıtım gerekmez.

Dağıtım seçenekleri

Dökümhane iki dağıtım seçeneği sağlar:

  • Sunucusuz APIAzure tarafından sunulan Foundry Modelleri ve iş ortakları ile topluluktan seçili Modeller dahil olmak üzere Foundry Modelleri için. Bu seçenek tercih edilen ve en yetenekli dağıtım yoludur. Standart, ayarlanmış aktarım hızı, toplu ve geliştirici dağıtım türlerini içerir.
  • Yönetilen işlem (önizleme) — Foundry'nin sizin için yönettiği ayrılmış GPU kapasitesi üzerinde çalışan açık kaynak, iş ortağı ve özel modeller için.

Dökümhane, seçtiğiniz modele göre uygun dağıtım seçeneğini belirler.

Yalnızca desteklenen bir modeli denemeniz gerekiyorsa, dağıtımı tamamen atlayabilir ve sunucusuz API veya yönetilen işlem dağıtımı oluşturmadan modelleri ada göre çağıran anlık erişimi (önizleme) kullanabilirsiniz.

Anlık erişim, başlatma sırasına göre Sunucusuz API dağıtım türleri ve yönetilen işlem arasında seçim yapılan diyagram.

Tam yetenek karşılaştırması için bkz . Dağıtım seçeneği karşılaştırması.

Sunucusuz API

Sunucusuz API, Foundry'de tercih edilen dağıtım seçeneğidir . En geniş özellik ve dağıtım türlerini destekler.

Hangi modeller sunucusuz API dağıtımları kullanır?

Azure tarafından satılan Foundry Modelleri ve iş ortaklarından ve topluluktan seçili Modeller dahil olmak üzere tüm Foundry Modelleri, sunucusuz API dağıtımı kullanır. Azure tarafından satılan Döküm Modelleri, Azure aboneliğiniz aracılığıyla faturalandırılan, Azure hizmet düzeyi sözleşmeleri kapsamında ve Microsoft tarafından desteklenen tüm Azure OpenAI modellerini ve en iyi sağlayıcılardan seçilen modelleri içerir. İş ortaklarının ve topluluğun sunucusuz API dağıtımlarını kullanan modelleri Anthropic modelleri ve Mistral, Cohere ve Meta gibi iş ortaklarının belirli modellerini içerir.

Sunucusuz API özellikleri

Sunucusuz API dağıtımları şunları destekler:

  • Birden çok dağıtım türü (veya dağıtım SKU'ları) — Genel Standart, Veri Bölgesi Standart, Standart (tek bölge), sağlanan, toplu iş ve daha fazlası. Her tür, verilerin nerede işlendiğini ve ödeme yönteminizi denetler. Ayrıntılar için bkz. Microsoft Döküm Modelleri için Dağıtım türleri.
  • Veri işleme esnekliği — Uyumluluk gereksinimlerinize göre bölgesel, veri bölgesi (ABD, AB veya APAC) veya küresel işlemeyi seçin.
  • Content filtreleme — Özelleştirilebilir yapılandırmalara sahip yerleşik Azure Yapay Zeka İçerik Güvenliği filtreleri.
  • Keyless authentication — Microsoft Entra ID (önerilir) ve anahtar tabanlı kimlik doğrulaması.
  • Özel ağ — Güvenli erişim için sanal ağ tümleştirmesi.
  • Sağlanan aktarım hızı — Öngörülebilir, düşük gecikme süreli performans için sağlanan aktarım hızı birimleriyle (PTU) kapasite ayırın. Ayrıntılar için bkz. Sağlanan aktarım hızı.

Kaynak gereksinimleri

Sunucusuz API dağıtımları şu durumlarda kullanılabilir:

  • Dökümhane kaynakları — Yeni Dökümhane projeleri için birincil kaynak türü. Yapay zeka hub'ı gerekmez.
  • Azure OpenAI kaynakları — Azure OpenAI kaynaklarını kullanıyorsanız, model kataloğu yalnızca Azure OpenAI modellerini dağıtım için gösterir. Tüm Dökümhane Modelleri setine erişebilmek için bir Dökümhane kaynağına yükseltin.

Sunucusuz API dağıtımına başlamak için bkz. Foundry portalında Microsoft Foundry Modellerini dağıtma veya Azure CLI ve Bicep kullanarak modelleri dağıtma.

Yönetilen işlem kaynağı dağıtımı (önizleme)

Note

Foundry'deki yönetilen bilgi işlem şu anda genel önizlemededir. Bu önizleme, hizmet düzeyi sözleşmesi olmadan sağlanır ve üretim iş yükleri için önerilmez. Bazı özellikler desteklenmeyebilir veya kısıtlı özelliklere sahip olabilir. Daha fazla bilgi için bkz. Microsoft Azure Önizlemeleri için Ek Kullanım Koşulları.

Foundry'deki yönetilen işlem altyapısı (önizleme), açık kaynaklı ve özel ağırlıklara sahip modelleri ayrılmış GPU kapasitesinde barındıran, hizmet olarak sunulan yönetilen bir GPU platformudur (PaaS). Yönetilen işlem dağıtımlarına, diğer dağıtım türlerinde olduğu gibi, aynı Foundry proje uç noktası üzerinden erişirsiniz; yönetmeniz gereken sanal makineler, kümeler veya sunum çalışma zamanları yoktur. Foundry dağıtımı ölçeklendirir, hızlandırıcıları sağlar ve çalışma zamanını yamalı tutar.

Önemli

Yönetilen bilgi işlem, açık kaynaklı, iş ortağı, sektöre özel ve özel modelleri destekler. Yönetilen işlem dağıtımları, aynı kimlik doğrulaması, ağ ve SDK yüzeyi kullanılarak birleşik Foundry proje uç noktasında sunulur.

Hangi modeller yönetilen işlem kullanır?

Yönetilen bilgi işlem kaynaklarını kullanarak Hugging Face Collection'dan modelleri dağıtıma alabilirsiniz. Örnekler şunları içerir:

  • Qwen modelleri
  • NVIDIA Nemotron modelleri
  • Seçili Meta modelleri
  • Seçili Mistral modelleri

Microsoft Foundry kataloğu, geniş ve büyüyen açık kaynak ve iş ortağı modellerinden oluşan bir seçim içerir. Geçerli katalog için bkz. model kataloğu.

Yönetilen bilgi işlem yetenekleri

Yönetilen hesaplama (Önizleme) şunları destekler:

  • Unified Foundry uç noktası ve kimlik doğrulaması — Belirteç başına ödeme ve sağlanan aktarım hızı dağıtımları olarak aynı proje uç noktasını, API anahtarlarını, Microsoft Entra ID ve özel ağı kullanın. Çıkarım yolları <endpoint>/managed-deployments/<deployment-name>/ kullanır. Sohbet tamamlama uyumlu çalışma zamanları da OpenAI SDK'sı ile standart /openai/v1/ yolu üzerinde çalışır.
  • Model örneği boyutlandırma : Dağıtımlar model merkezli terimlerle boyutlandırılır. Sanal makine SKU'larını seçmeniz gerekmez çünkü Foundry model boyutuna, mimariye, bağlam uzunluğuna ve iş yükünün gecikme süresi veya aktarım hızı için en iyi duruma getirilip getirildiğine göre örnek başına GPU'ları seçer.
  • Optimize edilmiş çıkarım çalışma zamanları — sürekli toplu işleme ve tensör paralelliği sunan, Microsoft tarafından seçilen vLLM, SGLang ve NVIDIA NIM kapsayıcıları.
  • Hızlandırıcı aileleri — A100 (80 GB), H100 (80 GB) ve MI300X (192 GB).
  • Otomatik ölçeklendirme ve sıfıra ölçeklendirme — Canlı trafikten otomatik ölçeklendirme veya el ile ölçeklendirme. Boşta kalma zaman aşımını yapılandırarak, trafik gelmediğinde dağıtımın sıfıra ölçeklendirilmesini ve faturalamanın hemen durdurulmasını sağlayın.
  • Microsoft tarafından yönetilen çalışma zamanları — Sunum çalışma zamanları, temel kapsayıcı görüntüleri ve güvenlik yamaları Microsoft tarafından sağlanır. Güncelleştirmeler canlı dağıtımlara otomatik olarak uygulanır.
  • Gözlemlenebilirlik ölçümleri — Her dağıtım, durum koduna ve yanıt süresi yüzdebirlik değerlerine göre API çağrı sayısını gösterir. Sohbet tamamlama modelleri ayrıca giriş ve çıkış belirteci sayılarını, ilk belirtece kadar geçen süre (TTFT) yüzdeliklerini ve toplam yanıt süresi yüzdeliklerini zamana göre gruplanmış olarak raporlar.

Faturalama ve kota

Yönetilen işlem faturalandırması, temel faturalama birimi GPU başına aktarım hızı olmak üzere, hızlandırıcı SKU’su başına saatlik olarak yapılır. Otomatik ölçeklendirme ve sıfıra ölçeklendirme, maliyetleri gerçek trafikle uyumlu hale getirir; böylece örnekler ölçeği azaltıldığında faturalama hemen durur.

Kota, Foundry kota süreci aracılığıyla bölge başına her hızlandırıcı SKU'su için verilir ve Azure VM kotasından ayrıdır. Azure sanal makineleri, bölgesel SKU’lara sahip bir hizmet olarak altyapı (IaaS) sunumudur; yönetilen bilgi işlem ise Global ve Data Zone işleme seçenekleriyle sunulan bir PaaS teklifidir. Mevcut Azure VM kotası yönetilen işlem dağıtımına uygulanamaz.

Yönetilen bilgi işlem şu anda küresel dağıtım için kullanılabilir. Fiyat tahminleri için bkz. Azure fiyatlandırma hesaplayıcısı.

Kullanmaya başlama

Yönetilen bilgi işlem dağıtımına başlamak için bkz. Yönetilen bilgi işlemle açık kaynak modelleri dağıtma.

Dağıtım seçeneği karşılaştırması

Mümkün olduğunda Sunucusuz API kullanın. Aşağıdaki tabloda iki dağıtım seçeneğindeki özellikler karşılaştırılmakta:

Note

Anlık erişim (önizleme) bu karşılaştırmada bir dağıtım seçeneği değildir. Sunucusuz API veya yönetilen işlem dağıtımı oluşturmadan desteklenen modelleri ada göre çağırır.

Yeteneği Sunucusuz API Yönetilen bilgi işlem
Hangi modeller dağıtılabilir? Azure tarafından satılan Foundry Modelleri ve iş ortakları ile topluluktan seçili Modeller dahil olmak üzere tüm Foundry Modelleri Model kataloğundan, NVIDIA NIM'den ve sektör modellerinden açık kaynak ve iş ortağı modelleri
Dağıtım kaynağı Dökümhane kaynağı Dökümhane projesi
AI Hub gerektirir Hayır Hayır
Veri işleme seçenekleri Bölgesel, veri bölgesi, genel Global
Özel ağ Evet Evet
İçerik filtreleme Yerleşik ve özelleştirilebilir Genel önizlemede kullanılamaz
Anahtarsız kimlik doğrulaması Evet (Microsoft Entra ID ve anahtar tabanlı) Evet (Microsoft Entra ID ve anahtar tabanlı)
Fatura Jeton kullanımı veya sağlanan aktarım hızı birimleri Hızlandırıcı SKU’su başına saatlik

Ipucu

Ayrıntılı fiyatlandırma bilgileri için bkz. Microsoft Foundry maliyetlerini planlama ve yönetme.