Środowisko uruchomieniowe sztucznej inteligencji

Ważna

Ta funkcja jest dostępna w publicznej wersji testowej.

AI Runtime to oferta obliczeniowa w usłudze Databricks przeznaczona do obsługi obciążeń uczenia głębokiego oraz zapewniająca wsparcie dla GPU w ramach usługi Databricks Serverless. Środowisko uruchomieniowe sztucznej inteligencji umożliwia trenowanie i dostosowywanie modeli niestandardowych przy użyciu ulubionych struktur oraz uzyskiwanie najnowocześniejszej wydajności, wydajności i jakości. Aby zapoznać się z omówieniem sposobu dopasowania bezserwerowych obliczeń do architektury usługi Databricks, zobacz Architektura bezserwerowego obszaru roboczego.

Kluczowe funkcje

  • W pełni zarządzana infrastruktura GPU: bezserwerowy, elastyczny dostęp do GPU bez konieczności konfigurowania klastra, wybierania sterowników ani zarządzania zasadami automatycznego skalowania.
  • Środowisko uruchomieniowe dedykowane do uczenia głębokiego: wybierz minimalne środowisko standardowe, aby uzyskać maksymalną elastyczność w zależnościach lub wstępnie załadowane środowisko sztucznej inteligencji z popularnymi strukturami uczenia maszynowego.
  • Natywnie zintegrowane w notesach, zadaniach, katalogu Unity i rozwiązaniu MLflow dla płynnego tworzenia, dostępu do danych i śledzenia eksperymentów.
  • Obsługa zgodności: obsługuje większość standardów zgodności. Aby uzyskać informacje o obsługiwanych standardach i wyjątkach, zobacz Profil zabezpieczeń zgodności.

Opcje sprzętu

Wszystkie akceleratory środowiska uruchomieniowego sztucznej inteligencji aprowizują pojedynczy węzeł. Liczba procesorów GPU w tym węźle zależy od typu akceleratora:

Akcelerator Liczba GPU na węzeł Pamięć procesora GPU Najlepsze dla Szkolenie rozproszone
1xA10 1 24 GB Małe i średnie zadania uczenia maszynowego i uczenia głębokiego, takie jak klasyczne modele uczenia maszynowego lub dostrajanie mniejszych modeli językowych Nieobsługiwane (pojedynczy procesor GPU)
1xH100 1 80 GB Obciążenia robocze, które wymagają więcej pamięci GPU, niż oferuje pojedynczy procesor GPU A10, ale nie wymagają rozproszonego trenowania na wielu procesorach GPU, takie jak dostrajanie modeli językowych średniej wielkości Nieobsługiwane (pojedynczy procesor GPU)
8xH100 8 80 GB na procesor GPU Obciążenia sztucznej inteligencji na dużą skalę, w tym trenowanie lub dostrajanie ogromnych modeli lub uruchamianie zaawansowanych zadań uczenia głębokiego Obsługiwane za pomocą dekoratora @distributed z gpus=8

Databricks zaleca korzystanie ze środowiska AI Runtime dla wszystkich niestandardowych przypadków użycia treningu modeli, które obejmują uczenie głębokie, klasyczne obciążenia robocze lub GPU na dużą skalę.

Przykład:

  • Optymalizacja LLM (LoRA, QLoRA, kompletna optymalizacja)
  • Przetwarzanie obrazów (wykrywanie obiektów, klasyfikacja obrazów)
  • Systemy rekomendacji oparte na uczeniu głębokim
  • Uczenie przez wzmacnianie
  • Prognozowanie szeregów czasowych opartych na uczeniu głębokim

Wymagania

  • Obszar roboczy w jednym z następujących regionów obsługiwanych przez Azure:
    • centralus
    • eastus
    • eastus2
    • northcentralus
    • westcentralus
    • westus
    • westus3

Ograniczenia

  • Środowisko uruchomieniowe sztucznej inteligencji obsługuje tylko akceleratory A10 i H100.
  • Środowisko uruchomieniowe sztucznej inteligencji nie obsługuje profilu zabezpieczeń zgodności dla standardów FedRAMP High ani DoD IL5. Obsługiwane są wszystkie inne standardy zgodności.
  • Dodawanie zależności przy użyciu panelu Środowiska nie jest obsługiwane w przypadku zaplanowanych zadań środowiska uruchomieniowego sztucznej inteligencji. Zainstaluj zależności programowo za pomocą polecenia %pip install w notesie.
  • W przypadku zaplanowanych zadań w środowisku AI Runtime, zachowanie automatycznego odzyskiwania dla niezgodnych wersji pakietów związanych z notebookiem nie jest obsługiwane.
  • Maksymalny czas wykonywania obciążenia wynosi siedem dni. W przypadku zadań trenowania modelu, które przekraczają ten limit, zaimplementuj zapisywanie stanu i uruchom ponownie zadanie po osiągnięciu maksymalnego czasu działania.
  • Środowisko uruchomieniowe sztucznej inteligencji zapewnia dostęp na żądanie do zasobów procesora GPU. Chociaż prowadzi to do łatwego, elastycznego dostępu do procesorów GPU, mogą występować okresy, w których pojemność jest ograniczona lub niedostępna w Twoim regionie.
  • Środowisko AI korzysta z międzyregionalnych GPU w niektórych przypadkach podczas wysokiego zapotrzebowania. Mogą istnieć koszty ruchu wychodzącego związane z takim użyciem, a łączność sieciowa między regionami może być ograniczona w określonym czasie.

Nawiązywanie połączenia ze środowiskiem uruchomieniowym sztucznej inteligencji

Możesz połączyć się interaktywnie ze środowiskiem uruchomieniowym AI z notatników, z terminala środowiska IDE przy użyciu tunelu SSH, z zaplanowanych zadań, interfejsu Jobs API i pakietów automatyzacji deklaratywnej. Aby uzyskać instrukcje krok po kroku, zobacz Connect to AI Runtime (Nawiązywanie połączenia ze środowiskiem uruchomieniowym AI).

Konfigurowanie środowiska

AI Runtime oferuje dwa zarządzane środowiska Python: minimalistyczne środowisko Standard oraz w pełni funkcjonalne środowisko Databricks AI, wstępnie wyposażone w popularne frameworki ML, takie jak PyTorch i Transformers. Aby uzyskać szczegółowe informacje na temat wybierania środowiska, zachowania buforowania, importowania modułów niestandardowych i znanych ograniczeń, zobacz Konfigurowanie środowiska.

Ładowanie danych w środowisku uruchomieniowym sztucznej inteligencji

Zrozumienie sposobu działania dostępu do danych w środowisku AI Runtime jest niezbędne w celu zapewnienia bezproblemowego środowiska. Aby uzyskać szczegółowe informacje, zobacz Ładowanie danych w środowisku uruchomieniowym sztucznej inteligencji.

Trenowanie rozproszone

AI Runtime obsługuje trenowanie rozproszone na wielu jednostkach GPU na jednym węźle, z którym jest połączony Twój komputer przenośny. Za pomocą dekoratora @distributed z interfejsu serverless_gpu API Python można uruchamiać obciążenia z wieloma procesorami GPU przy użyciu protokołu PyTorch DDP, FSDP lub DeepSpeed z minimalną konfiguracją. Aby uzyskać szczegółowe informacje, zobacz Trenowanie rozproszone w notesach.

Śledzenie i obserwowanie eksperymentów

Aby uzyskać informacje na temat integracji platformy MLflow, wyświetlania dzienników i zarządzania punktami kontrolnymi dla modeli, zobacz Śledzenie eksperymentów i obserwowalność.

Genie Code for deep learning (Kod genie na potrzeby uczenia głębokiego)

Genie Code obsługuje obciążenia uczenia głębokiego w środowisku uruchomieniowym sztucznej inteligencji. Może pomóc w generowaniu kodu szkoleniowego, rozwiązywaniu błędów instalacji biblioteki, sugerowaniu optymalizacji i debugowaniu typowych problemów. Zobacz Use Genie Code for data science (Używanie kodu Genie na potrzeby nauki o danych).

Guides

Aby uzyskać informacje na temat migracji z klasycznych obciążeń, przykładowych notesów i rozwiązywania problemów, zobacz Przewodniki użytkownika dotyczące środowiska uruchomieniowego sztucznej inteligencji.