Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Microsoft Döküm Modelleri, üretken yapay zeka uygulamaları için çok çeşitli yapay zeka modellerini keşfetmeye ve dağıtmaya yönelik merkezdir. Modeli çıkarım istekleri için kullanılabilir hale getirmek için dağıtırsınız. Dökümhane, model türüne ve altyapı gereksinimlerinize bağlı olarak iki dağıtım seçeneği sunar.
Ipucu
Her zaman dağıtım oluşturmanız gerekmez. Anında erişim (önizleme) ile desteklenen modelleri ada göre çağırır ve çıkarım çalıştırmaya hemen başlarsınız; dağıtım gerekmez.
Dağıtım seçenekleri
Dökümhane iki dağıtım seçeneği sağlar:
- Sunucusuz API — Azure tarafından sunulan Foundry Modelleri ve iş ortakları ile topluluktan seçili Modeller dahil olmak üzere Foundry Modelleri için. Bu seçenek tercih edilen ve en yetenekli dağıtım yoludur. Standart, ayarlanmış aktarım hızı, toplu ve geliştirici dağıtım türlerini içerir.
- Yönetilen işlem (önizleme) — Foundry'nin sizin için yönettiği ayrılmış GPU kapasitesi üzerinde çalışan açık kaynak, iş ortağı ve özel modeller için.
Dökümhane, seçtiğiniz modele göre uygun dağıtım seçeneğini belirler.
Yalnızca desteklenen bir modeli denemeniz gerekiyorsa, dağıtımı tamamen atlayabilir ve sunucusuz API veya yönetilen işlem dağıtımı oluşturmadan modelleri ada göre çağıran anlık erişimi (önizleme) kullanabilirsiniz.
Tam yetenek karşılaştırması için bkz . Dağıtım seçeneği karşılaştırması.
Sunucusuz API
Sunucusuz API, Foundry'de tercih edilen dağıtım seçeneğidir . En geniş özellik ve dağıtım türlerini destekler.
Hangi modeller sunucusuz API dağıtımları kullanır?
Azure tarafından satılan Foundry Modelleri ve iş ortaklarından ve topluluktan seçili Modeller dahil olmak üzere tüm Foundry Modelleri, sunucusuz API dağıtımı kullanır. Azure tarafından satılan Döküm Modelleri, Azure aboneliğiniz aracılığıyla faturalandırılan, Azure hizmet düzeyi sözleşmeleri kapsamında ve Microsoft tarafından desteklenen tüm Azure OpenAI modellerini ve en iyi sağlayıcılardan seçilen modelleri içerir. İş ortaklarının ve topluluğun sunucusuz API dağıtımlarını kullanan modelleri Anthropic modelleri ve Mistral, Cohere ve Meta gibi iş ortaklarının belirli modellerini içerir.
Sunucusuz API özellikleri
Sunucusuz API dağıtımları şunları destekler:
- Birden çok dağıtım türü (veya dağıtım SKU'ları) — Genel Standart, Veri Bölgesi Standart, Standart (tek bölge), sağlanan, toplu iş ve daha fazlası. Her tür, verilerin nerede işlendiğini ve ödeme yönteminizi denetler. Ayrıntılar için bkz. Microsoft Döküm Modelleri için Dağıtım türleri.
- Veri işleme esnekliği — Uyumluluk gereksinimlerinize göre bölgesel, veri bölgesi (ABD, AB veya APAC) veya küresel işlemeyi seçin.
- Content filtreleme — Özelleştirilebilir yapılandırmalara sahip yerleşik Azure Yapay Zeka İçerik Güvenliği filtreleri.
- Keyless authentication — Microsoft Entra ID (önerilir) ve anahtar tabanlı kimlik doğrulaması.
- Özel ağ — Güvenli erişim için sanal ağ tümleştirmesi.
- Sağlanan aktarım hızı — Öngörülebilir, düşük gecikme süreli performans için sağlanan aktarım hızı birimleriyle (PTU) kapasite ayırın. Ayrıntılar için bkz. Sağlanan aktarım hızı.
Kaynak gereksinimleri
Sunucusuz API dağıtımları şu durumlarda kullanılabilir:
- Dökümhane kaynakları — Yeni Dökümhane projeleri için birincil kaynak türü. Yapay zeka hub'ı gerekmez.
- Azure OpenAI kaynakları — Azure OpenAI kaynaklarını kullanıyorsanız, model kataloğu yalnızca Azure OpenAI modellerini dağıtım için gösterir. Tüm Dökümhane Modelleri setine erişebilmek için bir Dökümhane kaynağına yükseltin.
Sunucusuz API dağıtımına başlamak için bkz. Foundry portalında Microsoft Foundry Modellerini dağıtma veya Azure CLI ve Bicep kullanarak modelleri dağıtma.
Yönetilen işlem kaynağı dağıtımı (önizleme)
Note
Foundry'deki yönetilen bilgi işlem şu anda genel önizlemededir. Bu önizleme, hizmet düzeyi sözleşmesi olmadan sağlanır ve üretim iş yükleri için önerilmez. Bazı özellikler desteklenmeyebilir veya kısıtlı özelliklere sahip olabilir. Daha fazla bilgi için bkz. Microsoft Azure Önizlemeleri için Ek Kullanım Koşulları.
Foundry'deki yönetilen işlem altyapısı (önizleme), açık kaynaklı ve özel ağırlıklara sahip modelleri ayrılmış GPU kapasitesinde barındıran, hizmet olarak sunulan yönetilen bir GPU platformudur (PaaS). Yönetilen işlem dağıtımlarına, diğer dağıtım türlerinde olduğu gibi, aynı Foundry proje uç noktası üzerinden erişirsiniz; yönetmeniz gereken sanal makineler, kümeler veya sunum çalışma zamanları yoktur. Foundry dağıtımı ölçeklendirir, hızlandırıcıları sağlar ve çalışma zamanını yamalı tutar.
Önemli
Yönetilen bilgi işlem, açık kaynaklı, iş ortağı, sektöre özel ve özel modelleri destekler. Yönetilen işlem dağıtımları, aynı kimlik doğrulaması, ağ ve SDK yüzeyi kullanılarak birleşik Foundry proje uç noktasında sunulur.
Hangi modeller yönetilen işlem kullanır?
Yönetilen bilgi işlem kaynaklarını kullanarak Hugging Face Collection'dan modelleri dağıtıma alabilirsiniz. Örnekler şunları içerir:
- Qwen modelleri
- NVIDIA Nemotron modelleri
- Seçili Meta modelleri
- Seçili Mistral modelleri
Microsoft Foundry kataloğu, geniş ve büyüyen açık kaynak ve iş ortağı modellerinden oluşan bir seçim içerir. Geçerli katalog için bkz. model kataloğu.
Yönetilen bilgi işlem yetenekleri
Yönetilen hesaplama (Önizleme) şunları destekler:
-
Unified Foundry uç noktası ve kimlik doğrulaması — Belirteç başına ödeme ve sağlanan aktarım hızı dağıtımları olarak aynı proje uç noktasını, API anahtarlarını, Microsoft Entra ID ve özel ağı kullanın. Çıkarım yolları
<endpoint>/managed-deployments/<deployment-name>/kullanır. Sohbet tamamlama uyumlu çalışma zamanları da OpenAI SDK'sı ile standart/openai/v1/yolu üzerinde çalışır. - Model örneği boyutlandırma : Dağıtımlar model merkezli terimlerle boyutlandırılır. Sanal makine SKU'larını seçmeniz gerekmez çünkü Foundry model boyutuna, mimariye, bağlam uzunluğuna ve iş yükünün gecikme süresi veya aktarım hızı için en iyi duruma getirilip getirildiğine göre örnek başına GPU'ları seçer.
- Optimize edilmiş çıkarım çalışma zamanları — sürekli toplu işleme ve tensör paralelliği sunan, Microsoft tarafından seçilen vLLM, SGLang ve NVIDIA NIM kapsayıcıları.
- Hızlandırıcı aileleri — A100 (80 GB), H100 (80 GB) ve MI300X (192 GB).
- Otomatik ölçeklendirme ve sıfıra ölçeklendirme — Canlı trafikten otomatik ölçeklendirme veya el ile ölçeklendirme. Boşta kalma zaman aşımını yapılandırarak, trafik gelmediğinde dağıtımın sıfıra ölçeklendirilmesini ve faturalamanın hemen durdurulmasını sağlayın.
- Microsoft tarafından yönetilen çalışma zamanları — Sunum çalışma zamanları, temel kapsayıcı görüntüleri ve güvenlik yamaları Microsoft tarafından sağlanır. Güncelleştirmeler canlı dağıtımlara otomatik olarak uygulanır.
- Gözlemlenebilirlik ölçümleri — Her dağıtım, durum koduna ve yanıt süresi yüzdebirlik değerlerine göre API çağrı sayısını gösterir. Sohbet tamamlama modelleri ayrıca giriş ve çıkış belirteci sayılarını, ilk belirtece kadar geçen süre (TTFT) yüzdeliklerini ve toplam yanıt süresi yüzdeliklerini zamana göre gruplanmış olarak raporlar.
Faturalama ve kota
Yönetilen işlem faturalandırması, temel faturalama birimi GPU başına aktarım hızı olmak üzere, hızlandırıcı SKU’su başına saatlik olarak yapılır. Otomatik ölçeklendirme ve sıfıra ölçeklendirme, maliyetleri gerçek trafikle uyumlu hale getirir; böylece örnekler ölçeği azaltıldığında faturalama hemen durur.
Kota, Foundry kota süreci aracılığıyla bölge başına her hızlandırıcı SKU'su için verilir ve Azure VM kotasından ayrıdır. Azure sanal makineleri, bölgesel SKU’lara sahip bir hizmet olarak altyapı (IaaS) sunumudur; yönetilen bilgi işlem ise Global ve Data Zone işleme seçenekleriyle sunulan bir PaaS teklifidir. Mevcut Azure VM kotası yönetilen işlem dağıtımına uygulanamaz.
Yönetilen bilgi işlem şu anda küresel dağıtım için kullanılabilir. Fiyat tahminleri için bkz. Azure fiyatlandırma hesaplayıcısı.
Kullanmaya başlama
Yönetilen bilgi işlem dağıtımına başlamak için bkz. Yönetilen bilgi işlemle açık kaynak modelleri dağıtma.
Dağıtım seçeneği karşılaştırması
Mümkün olduğunda Sunucusuz API kullanın. Aşağıdaki tabloda iki dağıtım seçeneğindeki özellikler karşılaştırılmakta:
Note
Anlık erişim (önizleme) bu karşılaştırmada bir dağıtım seçeneği değildir. Sunucusuz API veya yönetilen işlem dağıtımı oluşturmadan desteklenen modelleri ada göre çağırır.
| Yeteneği | Sunucusuz API | Yönetilen bilgi işlem |
|---|---|---|
| Hangi modeller dağıtılabilir? | Azure tarafından satılan Foundry Modelleri ve iş ortakları ile topluluktan seçili Modeller dahil olmak üzere tüm Foundry Modelleri | Model kataloğundan, NVIDIA NIM'den ve sektör modellerinden açık kaynak ve iş ortağı modelleri |
| Dağıtım kaynağı | Dökümhane kaynağı | Dökümhane projesi |
| AI Hub gerektirir | Hayır | Hayır |
| Veri işleme seçenekleri | Bölgesel, veri bölgesi, genel | Global |
| Özel ağ | Evet | Evet |
| İçerik filtreleme | Yerleşik ve özelleştirilebilir | Genel önizlemede kullanılamaz |
| Anahtarsız kimlik doğrulaması | Evet (Microsoft Entra ID ve anahtar tabanlı) | Evet (Microsoft Entra ID ve anahtar tabanlı) |
| Fatura | Jeton kullanımı veya sağlanan aktarım hızı birimleri | Hızlandırıcı SKU’su başına saatlik |
Ipucu
Ayrıntılı fiyatlandırma bilgileri için bkz. Microsoft Foundry maliyetlerini planlama ve yönetme.
İlgili içerik
- Microsoft Foundry Modelleri için Deployment türleri
- Dökümhane portalında Microsoft Foundry Modellerini Dağıt
- Azure CLI ve Bicep kullanarak modelleri dağıtın
- Azure tarafından satılan Foundry modelleri
- İş ortaklarından ve topluluktan dökümhane modelleri
- Microsoft DökümHane Modellerine genel bakış
- Microsoft Foundry’de yönetilen işlem altyapısı