Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Ten artykuł zawiera najlepsze rozwiązania dotyczące monitorowania i interpretowania sygnałów procesora GPU na Azure Kubernetes Service (AKS). Zamiast patrzeć na metryki GPU firmy NVIDIA w izolacji, koreluj sygnały z wykorzystania, pamięci i kontekstu obciążenia, aby poprawić długoterminową wydajność i efektywność węzłów.
Ważna
Funkcje usługi AKS w wersji zapoznawczej są dostępne na zasadzie samoobsługi i wymagają zapisania się. Wersje zapoznawcze są udostępniane w wersji "as is" i "jako dostępne" i są wykluczone z umów dotyczących poziomu usług i ograniczonej gwarancji. Wersje zapoznawcze usługi AKS są częściowo objęte pomocą techniczną dla klientów, świadczoną w miarę możliwości. W związku z tym te funkcje nie są przeznaczone do użytku produkcyjnego. Aby uzyskać więcej informacji, zobacz następujące artykuły pomocy technicznej:
Omówienie wykorzystania procesora GPU w porównaniu z nasyceniem
Nie traktuj metryki DCGM_FI_DEV_GPU_UTIL NVIDIA DCGM jako bezpośredniego wyniku wydajności.
DCGM_FI_DEV_GPU_UTIL wskazuje tylko, jak często jądra są aktywne, więc nie informuje, czy obciążenie jest wydajne pod względem obliczeniowym. Bardziej dokładne wskazówki można uzyskać, korelując sygnały wykorzystania zamiast odczytywać je niezależnie. Porównaj DCGM_FI_DEV_GPU_UTIL z DCGM_FI_PROF_SM_ACTIVE, a następnie porównaj DCGM_FI_PROF_SM_ACTIVE z DCGM_FI_PROF_DRAM_ACTIVE, aby określić, czy wąskie gardło jest związane z obliczeniami, pamięcią, czy uruchamianiem i synchronizacją.
Wysoka DCGM_FI_DEV_GPU_UTIL przy niskiej DCGM_FI_PROF_SM_ACTIVE często wskazuje na problemy związane z narzutem startowym, zatrzymaniami synchronizacji lub konkurencją o pamięć. Wysokie DCGM_FI_PROF_SM_ACTIVE i niskie DCGM_FI_PROF_DRAM_ACTIVE bardziej odpowiadają zachowaniom typowym dla zadań obliczeniowych. Wyższe DCGM_FI_PROF_DRAM_ACTIVE względem niższego DCGM_FI_PROF_SM_ACTIVE zwykle wskazuje na wykonywanie ograniczone przez pamięć.
Note
DCGM_FI_PROF_SM_ACTIVE i DCGM_FI_PROF_DRAM_ACTIVE są polami profilowania DCGM i mogą nie być domyślnie wyświetlane dla wszystkich typów architektur procesora GPU firmy NVIDIA oferowanych w rozmiarach maszyn wirtualnych Azure.
To podejście skupione na korelacjach pomaga uniknąć skalowania w poziomie, kiedy głównym problemem może być wydajność jądra systemu lub wzorce dostępu do pamięci. Aby uzyskać szczegółowe informacje na temat semantyki metryk, zobacz podręcznik użytkownika narzędzia NVIDIA DCGM.
Używanie ciśnienia pamięci jako podstawowego sygnału planowania
Jeśli pamięć wielokrotnie zbliża się do progów stanu bliskiego wyczerpania pamięci, traktuj ten wzorzec jako wczesny wskaźnik niestabilności. Platforma Kubernetes nie ma natywnego sygnału ciśnienia pamięci procesora GPU, więc wyczerpanie pamięci VRAM zwykle jest widoczne tylko w przypadku, gdy kontener OOM zabija i przerwy w działaniu zasobnika, często również po telemetrii DCGM pokazuje trend.
Automatyzowanie akcji cyklu życia węzła na podstawie sygnałów kondycji procesora GPU
Ta praktyka jest szczególnie ważna w przypadku długowiecznych pul węzłów GPU usługi AKS, gdzie starzenie się serwerów może się różnić pomiędzy węzłami.
Dopasowanie sygnałów obserwowalności do decyzji dotyczących skalowania
W przypadku skalowania w pionie utwórz nową pulę węzłów na innej jednostce SKU maszyny wirtualnej Azure z obsługą GPU i migruj obciążenia, gdy przepustowość osiąga maksymalną przepustowość ograniczoną przez zasilanie lub temperaturę, na przykład gdy DCGM_FI_DEV_POWER_USAGE pozostaje w pobliżu limitu, podczas gdy DCGM_FI_PROF_SM_ACTIVE pozostaje na stałym poziomie pomimo zapotrzebowania.
Oddzielne zasady obserwowalności MIG i nie-MIG
Po włączeniu MIG zakres każdej metryki zmienia się, więc sygnały należy interpretować inaczej.
Publikowanie metryk wydajności GPU z uwzględnieniem kosztów
Optymalizacja pod kątem widoczności kosztów, a nie tylko pod kątem wydajności. Metryka pochodna o wysokiej wartości dla zespołów platformy AKS to używane sekundy procesora GPU w porównaniu z przydzielonymi sekundami procesora GPU. Użyj telemetrii DCGM i łączeń kontekstowych w Kubernetes, aby opublikować tę metrykę według przestrzeni nazw i klasy obciążenia, a następnie analizować ją w czasie jako wspólne KPI dla zespołów platformy i finansowych. To podejście definiuje wspólne źródło prawdy dla decyzji optymalizacji i pomaga zapobiec ukrywaniu nadmiernej alokacji przez zagregowane średnie wykorzystania.
Następne kroki
- Zapoznaj się z najlepszymi praktykami dotyczącymi GPU w usłudze AKS.
- Rozpocznij korzystanie z zarządzanej funkcji GPU w usłudze AKS.
- Zoptymalizuj alokację za pomocą węzłów multi-instance GPU (MIG).
- Skalowanie na podstawie sygnałów procesora GPU przy użyciu metryk KEDA i DCGM.