Możliwości platformy Azure Databricks w zakresie analizy danych i uczenia maszynowego

Azure Databricks ma ujednoliconą platformę do pełnego cyklu życia nauki o danych i uczenia maszynowego (ML), od pierwotnego pozyskiwania danych dzięki inżynierii cech, trenowaniu modelu, wdrażaniu i monitorowaniu produkcji. Azure Databricks integruje się z popularnymi frameworkami ML typu open source, dodając nadzór korporacyjny, obserwowalność i narzędzia operacyjne, określane zbiorczo jako MLOps.

Na tej stronie wymieniono główne możliwości ds i uczenia maszynowego uporządkowane według etapu przepływu pracy.

Eksploracyjna analiza danych

Azure Databricks upraszcza eksploracyjne analizy danych (EDA), udostępniając interaktywne, współpracujące i wspomagane sztuczną inteligencją narzędzia dla analityków danych. Analitycy danych mogą eksplorować dane przy użyciu czatów języka naturalnego, interfejsów użytkownika lub kodu, a także współpracować przy użyciu współedytowania kodu w czasie rzeczywistym i udostępniania kodu opartego na usłudze Git. Genie Code może wykonać w pełni zautomatyzowaną EDA lub działać jako asystent interaktywny.

Category Features
Interfejs użytkownika
Kolaboracja
Asystenci sztucznej inteligencji

Przygotowywanie i udostępnianie funkcji

Azure Databricks upraszcza dane dla uczenia maszynowego, ujednolicając zarządzanie danymi i obciążeniami uczenia maszynowego. Dzięki zarządzaniu wszystkimi danymi w ramach Unity Catalog oraz szczegółowej kontroli dostępu możesz dostosować obszary odpowiedzialności związane z inżynierią danych i uczeniem maszynowym tak, aby odpowiadały strukturze Twojej organizacji. Dane można przygotować do uczenia maszynowego przy użyciu dowolnych narzędzi inżynierii danych, takich jak potoki danych Lakeflow. Cechy są zarządzane w Feature Store na potrzeby udostępniania wsadowego i w czasie rzeczywistym, przy użyciu jednego, nadzorowanego źródła referencyjnego dla cech.

Genie Code przyspiesza wyszukiwanie i przygotowywanie danych dzięki przeglądaniu Unity Catalog w celu znalezienia odpowiednich tabel, sugerowaniu transformacji cech oraz generowaniu kodu dla potoków pozyskiwania danych i potoków cech.

Typ funkcji Features
Funkcje usługi Batch
  • Tabele cech w Unity Catalog przechowują wstępnie obliczone cechy wsadowe z automatycznym śledzeniem pochodzenia i mechanizmami nadzoru. Zespoły odkrywają i wykorzystują ponownie istniejące funkcje, zamiast budować potoki od podstaw.
  • Widoki cech udostępniają nowy interfejs API do definiowania cech, które można następnie wykorzystywać do wsadowego obliczania cech lub obliczania ich w czasie rzeczywistym.
Funkcje w czasie rzeczywistym
  • W przypadku wstępnie obliczonych cech magazyny cech online udostępniają tabele cech na potrzeby przypadków użycia związanych z obsługą modeli w czasie rzeczywistym.
  • Gdy dane wejściowe do tworzenia cech są dostępne tylko w czasie serwowania, serwowanie cech umożliwia obliczanie cech na żądanie, uzupełniając tabele cech. Funkcje są definiowane jako funkcje, a nie wstępnie skompilowane.
  • Widoki cech udostępniają nowy interfejs API do definiowania cech, które można następnie wykorzystywać do wsadowego obliczania cech lub obliczania ich w czasie rzeczywistym.
Dane bez struktury Wyszukiwanie sztucznej inteligencji umożliwia obsługę danych bez struktury i uruchamianie wyszukiwania semantycznego.

Trenowanie modeli uczenia maszynowego

Azure Databricks ma elastyczne narzędzia do trenowania modeli uczenia maszynowego i uczenia głębokiego. Wstępnie skonfigurowane i dostosowywalne środowiska umożliwiają korzystanie z własnych bibliotek ML, a bezserwerowe zasoby obliczeniowe CPU i akcelerowane przez GPU pozwalają na skalowanie w górę i wszerz na żądanie. Genie Code oferuje inteligentne rozwiązanie AutoML, przyjmując polecenia w języku naturalnym i tworząc kompletne przepływy pracy obejmujące wiele notatników na potrzeby przygotowywania cech, trenowania, dostrajania, oceny i wdrażania.

Category Features
Typy uczenia maszynowego Azure Databricks obsługuje wszystkie typy uczenia maszynowego, w tym:
  • Klasyczne uczenie maszynowe: nadzorowane i nienadzorowane uczenie się za pomocą biblioteki scikit-learn, XGBoost, LightGBM, Apache Spark MLlib i innych struktur uczenia maszynowego
  • Uczenie głębokie: trenowanie sieci neuronowej za pomocą procesorów PyTorch, TensorFlow i Hugging Face Transformers, w tym trenowanie rozproszone na wielu procesorach GPU
  • Dostrajanie hiperparametrów: automatyczne wyszukiwanie w przestrzeniach algorytmów i hiperparametrów przy użyciu narzędzi takich jak Optuna i Ray

Aby uzyskać informacje na temat generowania sztucznej inteligencji, zobacz Azure Databricks możliwości generowania sztucznej inteligencji.
Compute
  • Bezserwerowe obliczenia są uruchamiane natychmiast dla notesów interaktywnych i zaplanowanych przepływów pracy z automatycznym skalowaniem i bez zarządzania klastrem. Obsługuje zarówno klastry przyspieszone przez procesor CPU, jak i procesor GPU.
  • Klasyczne obliczenia mają zarządzanie jednym komputerem i klastrem zarówno dla obciążeń procesora CPU, jak i procesora GPU.
Środowiska i biblioteki
  • Bezserwerowe środowiska obliczeniowe zapewniają podstawowe środowiska, które można w pełni dostosować do uczenia maszynowego. W przypadku przetwarzania bezserwerowego procesora GPU środowisko uruchomieniowe sztucznej inteligencji zapewnia wstępnie skonfigurowane środowiska na potrzeby trenowania i wnioskowania opartego na procesorze GPU.
  • W przypadku klasycznych obliczeń środowisko Databricks Runtime for Machine Learning zapewnia wstępnie skonfigurowane środowiska klastrów z najważniejszymi bibliotekami do uczenia maszynowego, które są już zainstalowane i przetestowane pod kątem współpracy, zarówno dla klastrów CPU, jak i klastrów akcelerowanych przez GPU.
Asystenci kodowania sztucznej inteligencji

Śledzenie eksperymentów i zarządzanie nimi

MLflow zarządzany przez Azure Databricks stanowi podstawę powtarzalnego i podlegającego audytowi rozwoju rozwiązań ML. Integracje z Unity Catalog i Git zapewniają śledzenie i śledzenie pochodzenia zasobów danych oraz kodu. Każda wersja modelu w rejestrze łączy się z powrotem z przebiegiem trenowania, zestawem danych, środowiskiem i zatwierdzeniem git, które je wygenerowało, zapewniając pełny dziennik inspekcji dla dowolnego wdrożonego modelu.

Category Features
Śledzenie eksperymentów Śledzenie biblioteki MLflow rejestruje parametry, metryki i artefakty dla każdego przebiegu trenowania. Porównaj przebiegi w interfejsie użytkownika platformy MLflow, aby zidentyfikować konfigurację o najlepszej wydajności.
Rejestr modeli Modele w Unity Catalog udostępniają rejestr modeli MLflow zintegrowany z Unity Catalog. Wersjonowane artefakty modelu są zarządzane za pomocą aliasów cyklu życia (Staging, Production), kontroli dostępu, śledzenia pochodzenia i współdzielenia między obszarami roboczymi.
Odtwarzalności Notesy i kod mogą być wersjonowane przy użyciu folderów Git usługi Databricks i zintegrowanych z dowolnym dostawcą usługi Git.

Wdrażanie i obsługa modeli

Azure Databricks obsługuje zarówno wnioskowanie wsadowe, jak i obsługę w czasie rzeczywistym. Wnioskowanie wsadowe efektywnie wykorzystuje modele do przetwarzania dużych zbiorów danych, natomiast serwowanie modeli w czasie rzeczywistym udostępnia je jako punkty końcowe API o niskich opóźnieniach. Kod Genie może generować kod na potrzeby wdrażania modelu oraz diagnozować problemy i wydajność dla punktów końcowych obsługujących model.

Wzorzec obsługi Features
Wnioskowanie wsadowe
Obsługa w czasie rzeczywistym Obsługa modelu zapewnia punkty końcowe REST o małym opóźnieniu i wysokim czasie pracy z bezserwerowym skalowaniem automatycznym. Obsługuje to procesor CPU i procesor GPU dla dowolnej platformy uczenia maszynowego, a usługa Genie umożliwia ocenę i rozwiązywanie problemów z punktami końcowymi obsługującymi.
Wnioskowanie natywne dla języka SQL
  • Funkcje sztucznej inteligencji zapewniają przewidywania uczenia maszynowego dostępne dla języka SQL na potrzeby prognozowania, wykrywania anomalii i analizy czynników bez konieczności Python ani wdrażania modelu.
  • W przypadku modeli niestandardowych funkcja ai_query sztucznej inteligencji zapewnia wydajne wnioskowanie wsadowe wspierane przez punkty końcowe obsługujące model.

Ocena i monitorowanie

Azure Databricks zapewnia elastyczną ocenę szkolenia i ciągłego monitorowania w środowisku produkcyjnym. Dzienniki obsługi w czasie rzeczywistym w tabelach inferencyjnych zarządzanych w Unity Catalog oraz monitorowanie jakości danych umożliwiają monitorowanie za pomocą niestandardowych metryk, paneli i alertów.

Category Features
Oceny
  • Ocena modeli MLflow może służyć do definiowania metryk rejestrowanych w MLflow, a śledzenie w MLflow może rejestrować metryki obliczone przy użyciu własnego frameworka.
  • Kod Genie może pomóc w wybieraniu metryk oceny i pisaniu kodu oceny.
Rejestrowanie predykcji Tabele inferencji rejestrują żądania i odpowiedzi, umożliwiając monitorowanie, analitykę i tworzenie zbiorów treningowych.
Monitorowanie i alerty

Metodyka MLOps i ład

Azure Databricks zapewnia kompleksowy zestaw narzędzi do operacji uczenia maszynowego (MLOps) i nadzoru. MLOps Stacks udostępniają szablony umożliwiające automatyczne, powtarzalne promowanie ze środowiska deweloperskiego do środowiska produkcyjnego z wykorzystaniem infrastruktury jako kodu. Dane, cechy, modele i punkty końcowe są w pełni zarządzane przez Unity Catalog i AI Gateway.

Category Features
CI/CD w uczeniu maszynowym Stosy MLOps oparte na pakietach automatyzacji deklaratywnej zapewniają zarządzanie oparte na kodzie i wdrażanie infrastruktury uczenia maszynowego i przepływów pracy. Obejmuje to szablony CI/CD do automatyzacji szkolenia, oceny i wdrażania.
Aranżacja przepływu pracy Zadania Lakeflow koordynują wieloetapowe przepływy pracy ML w postaci zaplanowanych lub wyzwalanych potoków.
Zarządzanie zasobami danych i modelu Unity Catalog zapewnia ujednolicone zarządzanie danymi, cechami i zarejestrowanymi modelami. Szczegółowe mechanizmy kontroli dostępu, śledzenie pochodzenia i dzienniki inspekcji mają zastosowanie do wszystkich zasobów.
Zarządzanie punktami końcowymi modelu Brama sztucznej inteligencji zapewnia scentralizowany nadzór i monitorowanie punktów końcowych modelu, w tym limity szybkości, śledzenie użycia i rejestrowanie ładunków.

Obsługa typu open source

Azure Databricks zapewnia pełną obsługę ekosystemu uczenia maszynowego typu open source.

Możesz użyć dowolnej struktury uczenia maszynowego typu open source w Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray i nie tylko. MLflow lub narzędzia niestandardowe mogą przechowywać artefakty modelu w otwartych formatach, które można eksportować i uruchamiać poza Azure Databricks.

MLflow jest oprogramowaniem open source utworzonym przez Azure Databricks i używanym przez 10 000 organizacji. Dane śledzenia eksperymentów, artefakty modelu i definicje potoków są przechowywane w otwartych formatach.

Zarządzanie danymi i sztuczną inteligencją opierają się na interfejsach API Unity Catalog o otwartym kodzie źródłowym, a przechowywanie danych opiera się na otwartym formacie Delta Lake. Twoje dane dotyczące funkcji i zestawy danych szkoleniowych pozostają w otwartych, przenośnych plikach.

Dodatkowe zasoby