Not
Bu sayfaya erişim yetkilendirme gerektiriyor. Oturum açmayı veya dizinleri değiştirmeyi deneyebilirsiniz.
Bu sayfaya erişim yetkilendirme gerektiriyor. Dizinleri değiştirmeyi deneyebilirsiniz.
Bu makalede, Azure Kubernetes Service (AKS) GPU sinyallerini izlemek ve yorumlamak için en iyi yöntemler sağlanır. NVIDIA GPU ölçümlerine yalıtılarak bakmak yerine, uzun vadeli performansı ve düğüm verimliliğini geliştirmek için sinyalleri kullanım, bellek ve iş yükü bağlamı arasında ilişkilendirirsiniz.
Important
AKS önizleme özellikleri self servis ve kabul temelinde kullanılabilir. Önizlemeler "olduğu gibi" ve "mevcut olduğu şekilde" sağlanmakta olup, hizmet seviyesi anlaşmalarına ve sınırlı garantilere dahil edilmemektedir. AKS önizlemeleri, müşteri desteği ekibi tarafından maksimum çaba gösterilerek kısmen ele alınmaktadır. Bu nedenle, bu özellikler üretim kullanımı için tasarlanmamıştır. Daha fazla bilgi için aşağıdaki destek makalelerine bakın:
GPU kullanımını ve doygunluğu anlama
NVIDIA DCGM ölçümünü DCGM_FI_DEV_GPU_UTIL doğrudan verimlilik puanı olarak değerlendirmeyin.
DCGM_FI_DEV_GPU_UTIL yalnızca çekirdeklerin ne sıklıkta etkin olduğunu gösterir, bu nedenle iş yükünün işlem verimli olup olmadığını göstermez. Kullanım sinyallerini bağımsız olarak okumak yerine ilişkilendirerek daha doğru yönergeler elde edersiniz.
DCGM_FI_DEV_GPU_UTIL ile DCGM_FI_PROF_SM_ACTIVE'i karşılaştırın ve ardından DCGM_FI_PROF_SM_ACTIVE ile DCGM_FI_PROF_DRAM_ACTIVE'ü karşılaştırarak darboğazınızın işlem, bellek veya başlatma ve senkronizasyon yükünden kaynaklanıp kaynaklanmadığını belirleyin.
Yüksek DCGM_FI_DEV_GPU_UTIL ve düşük DCGM_FI_PROF_SM_ACTIVE, genellikle başlatma maliyeti, eşzamanlama duraklamaları veya bellek çekişmesine işaret eder. Yüksek DCGM_FI_PROF_SM_ACTIVE ile düşük DCGM_FI_PROF_DRAM_ACTIVE, işlem bağlı davranışıyla daha tutarlıdır. Daha yüksek DCGM_FI_PROF_DRAM_ACTIVE ve daha düşük DCGM_FI_PROF_SM_ACTIVE genellikle belleğe bağlı yürütmeye işaret eder.
Note
DCGM_FI_PROF_SM_ACTIVE ve DCGM_FI_PROF_DRAM_ACTIVE DCGM profil oluşturma alanlarıdır ve Azure Sanal Makine (VM) boyutlarında sunulan tüm NVIDIA GPU mimari türlerinde varsayılan olarak görünmeyebilir.
Bu bağıntı öncelikli yaklaşım, kök sorun çekirdek verimliliği veya bellek erişim desenleri olabileceğinde ölçeği genişletmeyi önlemenize yardımcı olur. Ayrıntılı ölçüm semantiği için NVIDIA DCGM kullanıcı kılavuzuna bakın.
Bellek baskısını birincil zamanlama sinyali olarak kullanma
Bellek art arda yetersiz bellek eşiklerine yaklaşıyorsa, bu deseni erken bir istikrarsızlık göstergesi olarak değerlendirin. Kubernetes'te doğal GPU-bellek basınç sinyali yoktur, bu nedenle VRAM tükenmesi genellikle yalnızca kapsayıcı OOM nedeniyle kapatmalar ve pod kesintisi olarak ortaya çıkar ve genellikle DCGM telemetrisi bu eğilimi gösterdikten çok sonra gerçekleşir.
GPU sistem durumu sinyallerinden düğüm yaşam döngüsü eylemlerini otomatikleştirme
Bu uygulama, konak eskimesinin düğümler arasında değişebileceği uzun ömürlü AKS GPU düğüm havuzları için özellikle önemlidir.
Gözlemlenebilirlik sinyallerini ölçeklendirme kararlarıyla uyumlu hale getirme
Dikey ölçeklendirme için, farklı bir Azure GPU özellikli VM SKU'su üzerinde yeni bir düğüm havuzu oluşturun ve güç veya termal kısıtlamalar aktarım hızını kısıtladığında, örneğin DCGM_FI_DEV_POWER_USAGE sınıra yakın kaldığında ve DCGM_FI_PROF_SM_ACTIVE talebe rağmen düz kaldığında, iş yüklerini taşıyın.
MIG ve MIG olmayan gözlemlenebilirlik ilkelerini ayırma
MIG etkinleştirildiğinde her ölçümün kapsamı kayar, bu nedenle sinyalleri farklı şekilde yorumlar.
Maliyet algılayan GPU verimliliği ölçümlerini yayımlama
Yalnızca performansı değil maliyet görünürlüğünü de iyileştirin. AKS platform takımları için yüksek değerli türetilmiş bir ölçüt, kullanılan GPU-saniyeleri ile ayrılan GPU-saniyelerinin karşılaştırılmasıdır. Bu ölçümü ad alanı ve iş yükü sınıfına göre yayımlamak için DCGM telemetrisini ve Kubernetes bağlam birleşimlerini kullanın, ardından zaman içinde platform ve finans ekipleri için paylaşılan bir KPI olarak gözden geçirin. Bu yaklaşım, iyileştirme kararları için ortak bir gerçek kaynağı tanımlar ve fazla ayırmanın toplam kullanım ortalamalarıyla gizlenmesini önlemeye yardımcı olur.
Sonraki Adımlar
- AKS için en iyi GPU yöntemlerini gözden geçirin.
- AKS tarafından yönetilen GPU gözlemlenebilirliğini kullanmaya başlayın.
- Çok örnekli GPU (MIG) düğümleriyle ayırmayı iyileştirin.
- KEDA ve DCGM ölçümlerini kullanarak GPU sinyallerine göre ölçeklendirin.