Notatka
Dostęp do tej strony wymaga autoryzacji. Może spróbować zalogować się lub zmienić katalogi.
Dostęp do tej strony wymaga autoryzacji. Możesz spróbować zmienić katalogi.
Azure Databricks ma ujednoliconą platformę do pełnego cyklu życia nauki o danych i uczenia maszynowego (ML), od pierwotnego pozyskiwania danych dzięki inżynierii cech, trenowaniu modelu, wdrażaniu i monitorowaniu produkcji. Azure Databricks integruje się z popularnymi frameworkami ML typu open source, dodając nadzór korporacyjny, obserwowalność i narzędzia operacyjne, określane zbiorczo jako MLOps.
Na tej stronie wymieniono główne możliwości ds i uczenia maszynowego uporządkowane według etapu przepływu pracy.
Eksploracyjna analiza danych
Azure Databricks upraszcza eksploracyjne analizy danych (EDA), udostępniając interaktywne, współpracujące i wspomagane sztuczną inteligencją narzędzia dla analityków danych. Analitycy danych mogą eksplorować dane przy użyciu czatów języka naturalnego, interfejsów użytkownika lub kodu, a także współpracować przy użyciu współedytowania kodu w czasie rzeczywistym i udostępniania kodu opartego na usłudze Git. Genie Code może wykonać w pełni zautomatyzowaną EDA lub działać jako asystent interaktywny.
| Category | Features |
|---|---|
| Interfejs użytkownika |
|
| Kolaboracja |
|
| Asystenci sztucznej inteligencji |
|
Przygotowywanie i udostępnianie funkcji
Azure Databricks upraszcza dane dla uczenia maszynowego, ujednolicając zarządzanie danymi i obciążeniami uczenia maszynowego. Dzięki zarządzaniu wszystkimi danymi w ramach Unity Catalog oraz szczegółowej kontroli dostępu możesz dostosować obszary odpowiedzialności związane z inżynierią danych i uczeniem maszynowym tak, aby odpowiadały strukturze Twojej organizacji. Dane można przygotować do uczenia maszynowego przy użyciu dowolnych narzędzi inżynierii danych, takich jak potoki danych Lakeflow. Cechy są zarządzane w Feature Store na potrzeby udostępniania wsadowego i w czasie rzeczywistym, przy użyciu jednego, nadzorowanego źródła referencyjnego dla cech.
Genie Code przyspiesza wyszukiwanie i przygotowywanie danych dzięki przeglądaniu Unity Catalog w celu znalezienia odpowiednich tabel, sugerowaniu transformacji cech oraz generowaniu kodu dla potoków pozyskiwania danych i potoków cech.
| Typ funkcji | Features |
|---|---|
| Funkcje usługi Batch |
|
| Funkcje w czasie rzeczywistym |
|
| Dane bez struktury | Wyszukiwanie sztucznej inteligencji umożliwia obsługę danych bez struktury i uruchamianie wyszukiwania semantycznego. |
Trenowanie modeli uczenia maszynowego
Azure Databricks ma elastyczne narzędzia do trenowania modeli uczenia maszynowego i uczenia głębokiego. Wstępnie skonfigurowane i dostosowywalne środowiska umożliwiają korzystanie z własnych bibliotek ML, a bezserwerowe zasoby obliczeniowe CPU i akcelerowane przez GPU pozwalają na skalowanie w górę i wszerz na żądanie. Genie Code oferuje inteligentne rozwiązanie AutoML, przyjmując polecenia w języku naturalnym i tworząc kompletne przepływy pracy obejmujące wiele notatników na potrzeby przygotowywania cech, trenowania, dostrajania, oceny i wdrażania.
| Category | Features |
|---|---|
| Typy uczenia maszynowego | Azure Databricks obsługuje wszystkie typy uczenia maszynowego, w tym:
Aby uzyskać informacje na temat generowania sztucznej inteligencji, zobacz Azure Databricks możliwości generowania sztucznej inteligencji. |
| Compute |
|
| Środowiska i biblioteki |
|
| Asystenci kodowania sztucznej inteligencji |
|
Śledzenie eksperymentów i zarządzanie nimi
MLflow zarządzany przez Azure Databricks stanowi podstawę powtarzalnego i podlegającego audytowi rozwoju rozwiązań ML. Integracje z Unity Catalog i Git zapewniają śledzenie i śledzenie pochodzenia zasobów danych oraz kodu. Każda wersja modelu w rejestrze łączy się z powrotem z przebiegiem trenowania, zestawem danych, środowiskiem i zatwierdzeniem git, które je wygenerowało, zapewniając pełny dziennik inspekcji dla dowolnego wdrożonego modelu.
| Category | Features |
|---|---|
| Śledzenie eksperymentów | Śledzenie biblioteki MLflow rejestruje parametry, metryki i artefakty dla każdego przebiegu trenowania. Porównaj przebiegi w interfejsie użytkownika platformy MLflow, aby zidentyfikować konfigurację o najlepszej wydajności. |
| Rejestr modeli |
Modele w Unity Catalog udostępniają rejestr modeli MLflow zintegrowany z Unity Catalog. Wersjonowane artefakty modelu są zarządzane za pomocą aliasów cyklu życia (Staging, Production), kontroli dostępu, śledzenia pochodzenia i współdzielenia między obszarami roboczymi. |
| Odtwarzalności | Notesy i kod mogą być wersjonowane przy użyciu folderów Git usługi Databricks i zintegrowanych z dowolnym dostawcą usługi Git. |
Wdrażanie i obsługa modeli
Azure Databricks obsługuje zarówno wnioskowanie wsadowe, jak i obsługę w czasie rzeczywistym. Wnioskowanie wsadowe efektywnie wykorzystuje modele do przetwarzania dużych zbiorów danych, natomiast serwowanie modeli w czasie rzeczywistym udostępnia je jako punkty końcowe API o niskich opóźnieniach. Kod Genie może generować kod na potrzeby wdrażania modelu oraz diagnozować problemy i wydajność dla punktów końcowych obsługujących model.
| Wzorzec obsługi | Features |
|---|---|
| Wnioskowanie wsadowe |
|
| Obsługa w czasie rzeczywistym | Obsługa modelu zapewnia punkty końcowe REST o małym opóźnieniu i wysokim czasie pracy z bezserwerowym skalowaniem automatycznym. Obsługuje to procesor CPU i procesor GPU dla dowolnej platformy uczenia maszynowego, a usługa Genie umożliwia ocenę i rozwiązywanie problemów z punktami końcowymi obsługującymi. |
| Wnioskowanie natywne dla języka SQL |
|
Ocena i monitorowanie
Azure Databricks zapewnia elastyczną ocenę szkolenia i ciągłego monitorowania w środowisku produkcyjnym. Dzienniki obsługi w czasie rzeczywistym w tabelach inferencyjnych zarządzanych w Unity Catalog oraz monitorowanie jakości danych umożliwiają monitorowanie za pomocą niestandardowych metryk, paneli i alertów.
| Category | Features |
|---|---|
| Oceny |
|
| Rejestrowanie predykcji | Tabele inferencji rejestrują żądania i odpowiedzi, umożliwiając monitorowanie, analitykę i tworzenie zbiorów treningowych. |
| Monitorowanie i alerty |
|
Metodyka MLOps i ład
Azure Databricks zapewnia kompleksowy zestaw narzędzi do operacji uczenia maszynowego (MLOps) i nadzoru. MLOps Stacks udostępniają szablony umożliwiające automatyczne, powtarzalne promowanie ze środowiska deweloperskiego do środowiska produkcyjnego z wykorzystaniem infrastruktury jako kodu. Dane, cechy, modele i punkty końcowe są w pełni zarządzane przez Unity Catalog i AI Gateway.
| Category | Features |
|---|---|
| CI/CD w uczeniu maszynowym | Stosy MLOps oparte na pakietach automatyzacji deklaratywnej zapewniają zarządzanie oparte na kodzie i wdrażanie infrastruktury uczenia maszynowego i przepływów pracy. Obejmuje to szablony CI/CD do automatyzacji szkolenia, oceny i wdrażania. |
| Aranżacja przepływu pracy | Zadania Lakeflow koordynują wieloetapowe przepływy pracy ML w postaci zaplanowanych lub wyzwalanych potoków. |
| Zarządzanie zasobami danych i modelu | Unity Catalog zapewnia ujednolicone zarządzanie danymi, cechami i zarejestrowanymi modelami. Szczegółowe mechanizmy kontroli dostępu, śledzenie pochodzenia i dzienniki inspekcji mają zastosowanie do wszystkich zasobów. |
| Zarządzanie punktami końcowymi modelu | Brama sztucznej inteligencji zapewnia scentralizowany nadzór i monitorowanie punktów końcowych modelu, w tym limity szybkości, śledzenie użycia i rejestrowanie ładunków. |
Obsługa typu open source
Azure Databricks zapewnia pełną obsługę ekosystemu uczenia maszynowego typu open source.
Możesz użyć dowolnej struktury uczenia maszynowego typu open source w Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray i nie tylko. MLflow lub narzędzia niestandardowe mogą przechowywać artefakty modelu w otwartych formatach, które można eksportować i uruchamiać poza Azure Databricks.
MLflow jest oprogramowaniem open source utworzonym przez Azure Databricks i używanym przez 10 000 organizacji. Dane śledzenia eksperymentów, artefakty modelu i definicje potoków są przechowywane w otwartych formatach.
Zarządzanie danymi i sztuczną inteligencją opierają się na interfejsach API Unity Catalog o otwartym kodzie źródłowym, a przechowywanie danych opiera się na otwartym formacie Delta Lake. Twoje dane dotyczące funkcji i zestawy danych szkoleniowych pozostają w otwartych, przenośnych plikach.