Użyj Genie Code z AI Runtime

Ważna

Ta funkcja jest dostępna w publicznej wersji testowej.

Genie Code pomaga tworzyć i debugować zadania uczenia głębokiego w notatnikach połączonych z AI Runtime. Może generować rozproszony kod treningowy, rozwiązywać problemy środowiskowe i zależnościowe oraz badać awarie obciążenia GPU.

Genie Code tworzy i uruchamia rozproszone obciążenie treningowe CNN na ośmiu kartach graficznych H100 w notatniku AI Runtime.

Requirements

Aby używać Genie Code z AI Runtime:

Wprowadzenie

  1. Otwórz notes Azure Databricks.

  2. Podłącz notebook do AI Runtime. Zobacz Nawiąż połączenie z AI Runtime z poziomu notatnika.

  3. Otwórz panel Genie Code.

  4. Opisz zakres pracy, który chcesz rozwinąć, lub problem, który chcesz rozwiązać.

  5. Przejrzyj proponowany plan, zmiany w przepisach i działania przed ich zatwierdzeniem.

    Ważna

    Genie Code potrafi popełniać błędy. Przejrzyj wygenerowany kod, zmiany środowiska i inne proponowane działania przed ich uruchomieniem. Niektóre diagnozy wymagają dodatkowych logów lub kontekstu obciążenia pracą.

Z czym może pomóc genie Code?

Opracuj rozproszone obciążenia szkoleniowe

Genie Code może generować lub aktualizować kod treningowy dla AI Runtime. Może pomóc wybrać odpowiednią strategię rozproszoną PyTorch, korzystać z @distributed API z pakietu serverless_gpu oraz stosować wzorce AI Runtime do ładowania danych, checkpointingu i śledzenia MLflow. Szczegóły i przykłady API można znaleźć w artykule Rozproszone szkolenie w notatnikach.

Rozwiązywanie problemów środowiskowych i zależności

Genie Code potrafi przeglądać obecne środowisko, odróżniać błędy kompatybilności pakietów od zmian w kodzie lub API oraz rekomendować ukierunkowane poprawki. Może też pomóc wybrać między środowiskiem Databricks AI a Standard, w zależności od zależności Twojego obciążenia. Aby uzyskać informacje o dostępnych środowiskach, zobacz : Ustaw swoje środowisko.

Debuguj GPU i rozproszone obciążenia

Genie Code może wykorzystywać wyjście z notebooka oraz dostępne logi do badania rozproszonych błędów treningowych, błędów komunikacyjnych, zawieszeń treningowych oraz problemów z pamięcią GPU. Może pomóc zidentyfikować pierwotną awarię i odróżnić ją od błędów na innych poziomach. Aby uzyskać informacje o przeglądaniu rozproszonych dzienników treningowych, zobacz Śledzenie eksperymentów i obserwowalność.

Przykładowe podpowiedzi

Opracuj rozproszone obciążenia szkoleniowe

  • Zaktualizuj ten notatnik, aby uruchamiać trening rozproszony na wszystkich ośmiu procesorach graficznych H100 w AI Runtime.
  • Przejrzyj ten notatnik dotyczący treningu rozproszonego i popraw sposób użycia elementu serverless_gpu oraz narzędzia MLflow.
  • "Dostosuj to obciążenie treningowe do AI Runtime i wyjaśnij ważne zmiany."

Rozwiązywanie problemów środowiskowych i zależności

  • "Ten notes przestał działać po zainstalowaniu nowego pakietu. Sprawdź środowisko i ustal, czy problem wynika z zależności lub zmiany API kodu."
  • "Czy to obciążenie powinno korzystać z Databricks AI czy środowiska Standardowego? Przeanalizuj jego zależności i zarekomenduj środowisko, zanim cokolwiek zmienisz.
  • "Zdiagnozuj ten błąd kompatybilności pakietu i zalec najmniejszą odpowiednią zmianę."

Debuguj GPU i rozproszone obciążenia

  • "Przeanalizuj ten nieudany rozproszony trening, korzystając z dostępnych wyników z każdego rangi i zidentyfikuj źródło przyczyny."
  • "Dlaczego ten rozproszony zakres pracy się zawiesza? Użyj wyjścia z notatnika, aby zasugerować kolejny krok debugowania."
  • "Zbadaj tę awarię pamięci GPU i zalec kolejny krok oparty na dowodach."

Dodatkowe zasoby