Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Ważna
Ta funkcja jest dostępna w publicznej wersji testowej.
AI Runtime oferuje dwa zarządzane środowiska Python do obliczeń GPU bez serwera. Standardowe środowisko obejmuje cuda. Począwszy od wersji 5 środowiska, torch i torchvision nie są już preinstalowane. Środowisko AI Databricks jest fabrycznie załadowane przez PyTorch, Transformers oraz inne frameworki ML i deep learning. Wybierz środowisko standardowe w celu uzyskania pełnej kontroli nad stosem zależności lub środowiska sztucznej inteligencji na potrzeby konfiguracji trenowania gotowej do użycia. Możesz zacząć od dowolnego środowiska i samodzielnie instalować więcej pakietów.
Tip
- Wybierz środowisko Standardowe dla pełnej kontroli nad zależnościami lub środowisko AI Databricks dla gotowego do użycia stosu ML.
- Standard zawiera
cuda. Od wersji środowiskowej 5torchitorchvisionnie są fabrycznie zainstalowane. Środowisko AI dodaje PyTorch, Transformers i wiele innych. - Zainstaluj więcej pakietów za pomocą
%uv pip install(w środowisku w wersji 5 i nowszej) lub%pip installw notebooku albo za pomocąenvironment.dependenciesw interfejsie wiersza polecenia.
Jakiego środowiska używać
Środowisko AI Runtime oferuje dwa zarządzane środowiska Python, środowisko standardowe i środowisko sztucznej inteligencji usługi Databricks.
| Środowisko | Kluczowe cechy | Kiedy stosować |
|---|---|---|
| Środowisko standardowe | Minimalny; zawiera cuda. Począwszy od wersji 5 środowiska, torch i torchvision nie są już preinstalowane. |
Chcesz mieć pełną kontrolę nad stosem zależności i wolisz zainstalować tylko to, czego potrzebujesz |
| Środowisko sztucznej inteligencji usługi Databricks | Popularne struktury uczenia maszynowego (takie jak PyTorch, Transformers i inne) są wstępnie załadowane. | Potrzebujesz kompletnego środowiska do trenowania, dostrajania i eksperymentowania bez ręcznego zarządzania zależnościami |
Możesz też użyć bazowego środowiska obszaru roboczego, które administrator obszaru roboczego utworzył na potrzeby AI Runtime. Zobacz Kompilacja pod bezserwerowe obliczenia GPU (AI Runtime).
Aby wybrać środowisko w notatniku, otwórz panel boczny Środowisko i wybierz środowisko bazowe:
Środowisko standardowe (minimalne środowisko)
Minimalne, stabilne środowisko zawierające tylko wymagane pakiety dla operacji środowiska uruchomieniowego sztucznej inteligencji. Środowisko obejmuje cuda do obsługi GPU. Począwszy od wersji 5 środowiska, torch i torchvision nie są już preinstalowane. Zainstaluj wersje potrzebne dla swojego obciążenia za pomocą %uv pip install lub %pip install. Informacje o pakietach zainstalowanych w każdej wersji środowiska znajdziesz w poniższych informacjach o wydaniu.
Najlepsze rozwiązanie: użytkownicy, którzy chcą mieć pełną kontrolę nad stosem zależności i wolą instalować tylko to, czego potrzebują.
Aby wybrać: W panelu bocznym Środowisko wybierz Standard v6 jako środowisko bazowe.
Aby uzyskać więcej informacji na temat wersji pakietów zainstalowanych w różnych wersjach, zobacz notatki o wydaniu:
Środowisko sztucznej inteligencji usługi Databricks
Dostępne w środowisku 4 lub nowszym. Środowisko sztucznej inteligencji jest oparte na środowisku standardowym z typowymi pakietami środowiska uruchomieniowego i pakietami specyficznymi dla uczenia maszynowego na procesorach GPU. Wstępnie zainstalowane pakiety obejmują:
- PyTorch (z obsługą CUDA)
- Transformers (Hugging Face)
- Dodatkowe zależności związane z uczeniem maszynowym/głębokim uczeniem (ML/DL)
Najlepsze dla: praktyków uczenia maszynowego, którzy chcą kompletnego środowiska do trenowania obciążeń, dostrajania i eksperymentowania bez ręcznego zarządzania zależnościami.
Aby wybrać: W panelu bocznym Środowisko wybierz AI v6 jako środowisko bazowe.
Aby uzyskać więcej informacji na temat wersji pakietów zainstalowanych w różnych wersjach, zobacz notatki o wydaniu:
Instaluj dodatkowe pakiety
Możesz zacząć od środowiska zarządzanego lub bazowego środowiska obszaru roboczego i zainstalować na nim własne pakiety Python. Sposób ich instalacji zależy od tego, jak podłączysz się do AI Runtime.
W notatniku
Zainstaluj pakiety na początku notebooka lub skryptu szkoleniowego za pomocą %uv pip, co instaluje je przy użyciu uv i działa szybciej niż %pip. Wersje pinowe, aby biegi były powtarzalne:
%uv pip install "trl==1.1.0"
%uv pip install "transformers==5.5.4"
Pełne informacje referencyjne dotyczące %pip i %uv pip, w tym informacje o tym, które wersje środowiska obsługują każde z nich, znajdziesz w artykule Zarządzanie bibliotekami za pomocą poleceń %uv.
Gdy używasz dekoratora @distributed do obciążeń wieloGPU, pakiety instalowane przed wywołaniem .distributed() są automatycznie snapshotowane i propagowane do wszystkich rozproszonych procesów. Całkowity rozmiar zainstalowanych pakietów nie może przekraczać 15 GB. Aby uzyskać więcej informacji, zobacz Dodawanie zależności do notesu.
Dzięki CLI
CLIair korzysta z tych samych środowisk zarządzanych. Wybierz jedną z nich za pomocą environment.version, a następnie pod environment.dependencies w pliku YAML obciążenia wypisz pakiety do zainstalowania na niej. Narzędzie CLI instaluje je w wybranym środowisku za pomocą uv, dzięki czemu nie musisz samodzielnie zarządzać osobnym środowiskiem wirtualnym:
environment:
version: '6'
dependencies:
- trl==1.1.0
- transformers==5.5.4
Aby zamiast tego rozpocząć pracę ze środowiskiem AI Databricks, ustaw version na identyfikator środowiska AI, taki jak databricks_ai_v5. Aby poznać pełny format definiowania zależności, obsługiwane flagi instalacji oraz obsługę niestandardowych obrazów Dockera, zobacz sekcję Zależności języka Python.
Środowiska podstawowe obszaru roboczego
Administrator obszaru roboczego może utworzyć środowisko podstawowe obszaru roboczego dla bezserwerowych obliczeń procesora GPU, które udostępnia wszystkim użytkownikom w obszarze roboczym za pomocą menu rozwijanego Środowisko podstawowe . Aby uzyskać więcej informacji, zobacz Kompilacja dla bezserwerowego przetwarzania GPU (AI Runtime).
Aby użyć środowiska bazowego w zaplanowanym zadaniu, odwołaj się do niego za pomocą jego identyfikatora w bloku environments zadania lub pakietu. Na przykład to zadanie Declarative Automation Bundles wybiera środowisko AI Databricks:
resources:
jobs:
train:
tasks:
- task_key: train
environment_key: default
environments:
- environment_key: default
spec:
base_environment: databricks_ai_v6
Pełny przykład zadania znajdziesz w sekcji Planowanie za pomocą Jobs API i Declarative Automation Bundles.
Buforowanie środowiska i moduły niestandardowe
Kiedy środowiska są buforowane?
AI Runtime buforuje środowisko twojego notesu, więc po ponownym otwarciu notatnika nie musisz ponownie instalować pakietów. Szczegóły można znaleźć w artykule Resetuj zależności środowiska.
Buforowanie dotyczy interaktywnych notesów. Obciążenia robocze uruchamiane za pomocą air interfejsu wiersza polecenia (CLI) lub jako zadania według harmonogramu nie korzystają z tej pamięci podręcznej; każde uruchomienie za każdym razem instaluje zależności od nowa.
Dobrą praktyką jest przypisywanie pakietów do określonej wersji, aby środowisko zapisane w pamięci podręcznej pozostało prawidłowe, a uruchomienia były powtarzalne.
Jak zaimportować moduły niestandardowe?
Poniższe kroki pokazują, jak korzystać z własnych modułów Python.
- Zsynchronizuj swój kod z przestrzenią roboczą. Sklonuj repozytorium Git do workspace za pomocą folderu Git lub przesyłaj pliki bezpośrednio jako pliki workspace. Przechowuj współdzielony kod pod projektami
/Workspace/Sharedzespołowymi lub w folderze użytkownika do rozwoju osobistego. Przechowywanie kodu w folderze Git utrzymuje kontrolę wersyjną. -
Dodaj folder do
sys.pathi zaimportuj go na początku notatnika lub skryptu treningowego:
import sys
sys.path.append("/Workspace/Shared/my-project/src")
from my_module import my_function
Ograniczenia
Następujące możliwości nie są dostępne w środowisku uruchomieniowym sztucznej inteligencji:
- Funkcje platformy Spark: nie można bezpośrednio importować ani używać funkcji PySpark. Środowisko uruchomieniowe sztucznej inteligencji jest środowiskiem tylko dla języka Python; Platforma Spark nie jest dostępna jako środowisko uruchomieniowe lokalne. Jednak program Spark Connect jest dostępny do ładowania danych. Zobacz Ładowanie danych w środowisku uruchomieniowym sztucznej inteligencji.
- Biblioteki uczenia maszynowego środowiska Databricks Runtime: wstępnie zainstalowane pakiety nie zastępują usługi Databricks Runtime ML. Niektóre biblioteki uczenia maszynowego dostępne w środowisku Databricks Runtime ML mogą nie być wstępnie zainstalowane w środowisku uruchomieniowym sztucznej inteligencji.
- Prywatne artefakty: środowisko uruchomieniowe sztucznej inteligencji obsługuje w niektórych przypadkach prywatne artefakty. Aby uzyskać więcej informacji, skontaktuj się z zespołem ds. kont.