Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Azure Kubernetes Service (AKS) yapay zeka/ML eğitimi, gerçek zamanlı çıkarım ve büyük ölçekli veri analizi gibi yoğun işlem gücü gerektiren iş yüklerini çalıştırmak için NVIDIA GPU özellikli düğüm havuzlarını destekler. Geleneksel olarak GPU’lar, tek bir Kubernetes podunun bir Azure sanal makinesi (VM) içindeki GPU aygıtının tamamını kullandığı bire bir modelde tahsis edilir. Bu model basitlik ve güçlü yalıtım sağlarken, iş yüklerinin kümedeki kullanılabilir GPU kaynaklarını tam olarak kullanmadığı senaryolarda az kullanıma yol açabilir.
Müşteriler, kullanımı geliştirmek ve eşzamanlı iş yüklerini desteklemek için düğüm havuzlarında farklı GPU bölümleme stratejilerini tümleştirebilir. Bu yaklaşımlar, birden çok iş yükünün tek bir fiziksel GPU'yı daha küçük mantıksal birimlere bölerek veya yazılım veya GPU sürücü düzeyinde erişimi genişleterek paylaşmasına olanak tanır.
Bu makalede AKS'de NVIDIA GPU'ları için üç birincil düğüm bölümleme stratejisi hakkında bilgi ediniyorsunuz: Çok Örnekli GPU (MIG), zaman dilimleme ve Çok İşlemli Hizmet (MPS)..
AKS'de GPU düğümü bölümleme stratejilerine genel bakış
AKS ortamlarında kullanılabilen üç birincil strateji, Çok Örnekli GPU (MIG), zaman dilimleme ve Çok İşlemli Hizmet (MPS) şeklindedir. Her yaklaşım AKS platformu yönetimi, yalıtım türü ve dağıtım kullanım örnekleri açısından farklılık gösterir.
| Strateji | AKS'de yönetilen veya izin verilenler | GPU paylaşım türü | Önerilen |
|---|---|---|---|
| Çoklu Instans GPU (MIG) | Yönetilen (veya GPU operatörü aracılığıyla kullanıcı tarafından yönetilen) | Donanım bölümleme | Üretim iş yükleri |
| Zaman dilimleme (NVIDIA GPU Operatörü aracılığıyla) | Kullanıcı tarafından yönetilen, AKS izinli | Yazılım zamanlaması | Değişken GPU yükleriyle deneme |
| Çok İşlemli Hizmet (MPS, NVIDIA GPU operatörü) | Kullanıcı tarafından yönetilen, AKS’ye izin verilen | CUDA düzeyinde işlem çoğullama | Düşük gecikme süreli, yüksek aktarım hızına sahip iş yükleri |
AKS’de Yönetilen Çok Örnekli GPU (MIG)
Çok Örnekli GPU (MIG), A100, H100 ve H200 serisi gibi belirli NVIDIA GPU mimarilerinde kullanılabilen donanım tabanlı bir bölümleme özelliğidir. MIG, tek bir fiziksel GPU’nun, her biri kendine ayrılmış işlem çekirdekleri, bellek ve önbelleğe sahip birden fazla yalıtılmış örneğe bölünmesini sağlar. Bu, güçlü iş yükü yalıtımı ve öngörülebilir performans özellikleri sağlayarak MIG'yi üretim ortamları için uygun hale getirir.
AKS'de MIG yönetilen bir özelliktir. MIG özellikli düğüm havuzu sağlandığında, Azure GPU donanımını yapılandırırken, gerekli sürücü yığınını yükleyip korur ve NVIDIA cihaz eklentisi aracılığıyla MIG örneklerini Kubernetes ile tümleştirir. Her MIG dilimi, Kubernetes zamanlayıcısına ayrı bir ayrılabilir kaynak olarak sunulur; bu da pod'ların GPU kapasitesini ince ayrıntılı ve deterministik bir şekilde talep etmesine olanak tanır.
Bu yaklaşım, kurumsal dağıtımlar için çeşitli avantajlar sunar. Donanım düzeyinde bölümleme aracılığıyla üretim düzeyinde yalıtım sağlar ve sürücü güncelleştirmeleri ve yapılandırma dahil olmak üzere yaşam döngüsü yönetimini AKS'ye temsilci olarak vererek işlem yükünü azaltır. Buna ek olarak, MIG örnekleri zamanlayıcı perspektifinden bağımsız GPU cihazları gibi davranarak öngörülebilir yerleştirme ve kaynak ayırmayı etkinleştirir.
Ancak MIG bazı kısıtlamalar da getirir: bölümleme yapılandırmaları düğüm havuzu düzeyinde statiktir ve bu da değişikliklerin düğüm yeniden sağlama gerektirdiği anlamına gelir. Esneklik, temel GPU donanımı tarafından desteklenen önceden tanımlanmış MIG profilleriyle sınırlıdır.
NVIDIA GPU Operatörü ile zaman dilimleme (Kullanıcı yönetimli)
Zaman dilimleme, birden fazla Kubernetes podunun çalıştırmayı zaman içinde dönüşümlü olarak gerçekleştirerek tek bir GPU'yu paylaşmasına olanak tanıyan, yazılım tabanlı bir GPU paylaşım mekanizmasıdır. Bu yaklaşım GPU sürücülerini, Kubernetes cihaz eklentisini ve kapsayıcı çalışma zamanı yapılandırmasını yöneten NVIDIA GPU Operatörü aracılığıyla uygulanır.
Zaman dilimleme AKS düğüm havuzlarında yapılandırılabilir ancak platform tarafından yönetilemez . Küme operatörleri genellikle Helm aracılığıyla NVIDIA GPU operatörünü dağıtmak ve yapılandırmak ve cihaz eklentisi ayarları aracılığıyla zaman dilimleme özelliğini etkinleştirmekten sorumludur. Yapılandırıldıktan sonra, birden çok pod aynı GPU kaynağına erişim talep edebilir ve iş yükleri zaman paylaşımlı olarak zamanlanır.
Zaman dilimleme, belirli GPU donanım özelliklerine bağlı olmadığından ve CUDA tarafından desteklenen çoğu NVIDIA GPU ile kullanılabildiğinden esneklik ve geniş uyumluluk sunar. Ani veya değişken GPU kullanım desenlerine sahip geliştirme, test veya iş yükleri için kullanışlıdır.
Esnekliğine rağmen zaman dilimleme, donanım düzeyinde yalıtım sağlamaz. Tüm iş yükleri aynı GPU belleğini ve işlem kaynaklarını paylaşır ve bu da çekişme ve öngörülemeyen performansa neden olabilir. Yapılandırma ve yaşam döngüsü yönetimi kullanıcı odaklı olduğundan, işleçlerin sürücü güncelleştirmelerini, uyumluluğu ve ayarlamayı da işlemesi gerekir. Bu nedenle, katı hizmet düzeyi sözleşmeleri (SLA) gerektiren üretim iş yükleri için genellikle zaman dilimleme önerilmez.
NVIDIA GPU operatörü ile Çoklu İşlem Hizmeti (MPS) (Kullanıcı tarafından yönetilen)
NVIDIA Çoklu İşlem Hizmeti (MPS), birden çok CUDA uygulamasının tek bir GPU üzerinde eşzamanlı olarak yürütülmesini sağlayan sürücü düzeyinde bir özelliktir. İş yükleri arasında yürütmeyi alternatif olarak gerçekleştiren zaman dilimlemesinden farklı olarak MPS, farklı işlemlerdeki çekirdeklerin aynı anda çalışmasını sağlayarak genel GPU kullanımını artırır ve uyumlu iş yükleri için gecikme süresini azaltır.
AKS'de MPS, NVIDIA GPU Operatörünün kullanıcı tarafından yönetilen dağıtımıyla yapılandırılabilir. Operatörlerin MPS'yi etkinleştirmek ve MPS denetim daemon'unun yaşam döngüsünü yönetmek için GPU sürücü ortamını yapılandırmaları gerekir. Aynı MPS sunucusuna bağlanan iş yükleri GPU'yu paylaşabilir ve eşzamanlı çekirdek yürütmesinden yararlanabilir.
MPS, toplu işler veya sıkı bir şekilde bağlanmış paralel iş yükleri gibi yüksek aktarım hızı ve düşük gecikme süresi senaryoları için kullanışlıdır. GPU paylaşımı üzerinde ayrıntılı denetim sağlar ve iş yükleri eşzamanlı yürütmeden yararlanacak şekilde tasarlandığında kullanımı önemli ölçüde iyileştirebilir.
Ancak, MPS ek operasyonel karmaşıklık sağlar. Yapılandırma el ile gerçekleştirilir ve diğer yaklaşımlara kıyasla sorun giderme işlemleri daha fazla söz konusu olabilir. Zaman dilimleme işlemine benzer şekilde, tüm işlemler GPU belleğini ve işlem kaynaklarını paylaştığı için MPS güçlü yalıtım sağlamaz. Bu nedenle MPS genellikle katı hizmet düzeyi sözleşmeleri (SLA) gerektiren üretim iş yükleri için önerilmez.
GPU bölümleme stratejisi seçme
AKS'de uygun GPU bölümleme stratejisinin seçilmesi iş yükü gereksinimlerine, işletimsel tercihlere ve performans beklentilerine bağlıdır. MIG, güçlü yalıtım ve öngörülebilir performans gerektiren üretim ortamları için önerilen yaklaşımdır. AKS düğüm havuzu özelliği olarak, MIG işlemleri basitleştirir ve yönetim yükünü azaltır.
Zaman dilimleme, kullanımı en üst düzeye çıkarmanın tutarlılıktan daha önemli olduğu, üretim dışı ortamlar veya dalgalı GPU talebine sahip iş yükleri için kullanışlıdır. Donanımdan bağımsız bir çözüm sağlar, ancak dikkatli bir yönetim gerektirir ve performans yalıtımını garanti etmez.
MPS, eşzamanlı GPU yürütme ve düşük gecikme süresinden yararlanan özel iş yükleri için idealdir. En yüksek potansiyel kullanım verimliliğini sunar; ancak artan karmaşıklık ve asgari düzeyde yalıtımla birlikte geldiğinden, en çok CUDA farkındalığına sahip uygulamalar kullanan ileri düzey kullanıcılar için uygundur.
Pratikte kuruluşlar, üretim kümeleri için MIG kullanırken geliştirme veya deneysel senaryolarda zaman dilimleme ya da MPS'den yararlanarak farklı ortamlarda farklı stratejiler benimseyebilir. GPU iş yükü özelliklerinin ve operasyonel kısıtlamaların dikkatli bir şekilde değerlendirilmesi, en etkili uzun vadeli bölümleme yaklaşımını seçmek için gereklidir.
İlgili içerik
- AKS'de çok örnekli GPU düğüm havuzlarını kullanmaya başlayın.
- GPU özellikli düğüm yaşam döngüsü yönetimi için en iyi yöntemler hakkında bilgi edinin.
- Kümenizde düğüm kutusu paketlemesini yapılandırarak GPU düğümü kullanımını ve performansını iyileştirin.