Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Azure Databricks má jednotnou platformu pro úplný životní cyklus datových věd (DS) a strojového učení (ML) od nezpracovaného příjmu dat prostřednictvím přípravy funkcí, trénování modelů, nasazení a monitorování produkce. Azure Databricks se integruje s oblíbenými opensourcovými architekturami ML, přidáním zásad správného řízení na podnikové úrovni, pozorovatelnosti a provozních nástrojů, které se souhrnně označují jako MLOps.
Tato stránka obsahuje hlavní možnosti DS a ML uspořádané podle dílčí fáze pracovního postupu.
Průzkumná analýza dat
Azure Databricks zjednodušuje průzkumnou analýzu dat (EDA) tím, že poskytuje interaktivní, spolupráci a nástroje asistované umělé inteligence pro datové vědce. Datoví vědci můžou zkoumat data pomocí chatu v přirozeném jazyce, uživatelských rozhraní nebo kódu a mohou spolupracovat pomocí spoluvytváření v reálném čase i sdílení kódu založeného na Gitu. Genie Code může plně automatizovat EDA nebo pracovat jako interaktivní asistent.
| Category | Features |
|---|---|
| Uživatelské rozhraní |
|
| Collaboration |
|
| Asistenti umělé inteligence |
|
Příprava a obsluha funkcí
Azure Databricks zjednodušuje data pro ML sjednocením zásad správného řízení úloh dat a ML. Se všemi daty spravovanými v katalogu Unity s jemně odstupňovanými ovládacími prvky přístupu můžete upravit datové inženýrství a hranice ML tak, aby vyhovovaly vaší organizaci. Data je možné připravit na STROJOVÉ učení pomocí libovolných nástrojů pro přípravu dat , jako jsou kanály Lakeflow. Příznaky se spravují v Feature Store pro dávkové poskytování i poskytování v reálném čase, přičemž pro příznaky slouží jako jediný spravovaný zdroj pravdy.
Genie Code zrychluje zjišťování a přípravu dat procházením katalogu Unity a zjišťuje relevantní tabulky, navrhuje transformace funkcí a generuje kód pro příjem dat a kanály funkcí.
| Typ funkce | Features |
|---|---|
| Funkce služby Batch |
|
| Funkce v reálném čase |
|
| Nestrukturovaná data | AI Search umožňuje obsluhovat nestrukturovaná data a sémantické vyhledávání. |
Trénování modelů ML
Azure Databricks nabízí flexibilní nástroje pro trénování modelů strojového učení a hlubokého učení. Předem nakonfigurovaná a přizpůsobitelná prostředí umožňují používat vlastní knihovny ML a bezserverové výpočetní prostředky a výpočetní prostředky s akcelerovanými gpu umožňují vertikální navýšení a horizontální navýšení kapacity na vyžádání. Genie Code poskytuje inteligentní AutoML, který přijímá požadavky přirozeného jazyka a vytváří kompletní pracovní postupy s více poznámkovými bloky pro featurizaci, trénování, ladění, hodnocení a nasazení.
| Category | Features |
|---|---|
| Typy strojového učení | Azure Databricks podporuje všechny typy ML, včetně:
Informace o generování umělé inteligence najdete v tématu Azure Databricks možnosti generování umělé inteligence. |
| Compute |
|
| Prostředí a knihovny |
|
| AI asistenti pro programování |
|
Sledování a správa experimentů
Azure Databricks spravované MLflow poskytuje základ pro reprodukovatelný a auditovatelný vývoj ML. Jeho integrace s Unity Catalog a Gitem umožňují sledování a dohledání původu datových a kódových prostředků. Každá verze modelu v registru odkazuje zpět na trénovací běh, datovou sadu, prostředí a potvrzení Gitu, které ho vytvořilo, a poskytuje kompletní záznam auditu pro libovolný nasazený model.
| Category | Features |
|---|---|
| Sledování experimentů | MLflow tracking zaznamenává parametry, metriky a artefakty pro každý trénovací běh. Porovnejte spuštění v uživatelském rozhraní MLflow a identifikujte tak konfiguraci s nejlepším výkonem. |
| Rejstřík modelů |
Modely v katalogu Unity poskytují registr modelů MLflow integrovaný s katalogem Unity. Verzované artefakty modelu jsou spravovány pomocí aliasů životního cyklu (Staging, Production), řízení přístupu, sledování původu a sdílení mezi pracovními oblastmi. |
| Reprodukovatelnost | Poznámkové bloky a kód lze verzovat pomocí složek Databricks Git a integrovat s libovolným poskytovatelem Git. |
Nasazení a obsluha modelů
Azure Databricks podporuje dávkové odvozování i obsluhu v reálném čase. Dávková inference efektivně aplikuje modely na velké datové sady, zatímco nasazení v reálném čase zpřístupňuje modely prostřednictvím API endpointů s nízkou latencí. Genie Code může generovat kód pro nasazení modelu a diagnostikovat problémy a výkon pro koncové body obsluhy modelu.
| Způsob poskytování | Features |
|---|---|
| Dávkové odvozování |
|
| Obsluha v reálném čase | Poskytování modelů poskytuje koncové body REST spravované bezserverovým automatickým škálováním s nízkou latencí a vysokou dostupností. To podporuje využití procesoru a GPU pro libovolnou architekturu ML a pomocí Genie můžete vyhodnotit koncové body a řešit potíže s obsluhou koncových bodů. |
| SQL‑nativní inferování |
|
Vyhodnocení a monitorování
Azure Databricks poskytuje flexibilní vyhodnocení pro trénování a průběžné monitorování pro produkční prostředí. Protokoly obsluhy v reálném čase do inferenčních tabulek spravovaných v Unity Catalog a monitorování kvality dat umožňují monitorování pomocí vlastních metrik, řídicích panelů a upozornění.
| Category | Features |
|---|---|
| Evaluation |
|
| Protokolování předpovědí | Tabulky inferencí zaznamenávají požadavky a odpovědi při obsluze, což umožňuje monitorování, analýzy a vytváření trénovacích datových sad. |
| Monitorování a upozornění |
|
MLOps a zásady správného řízení
Azure Databricks poskytuje úplnou sadu nástrojů pro operace ML (MLOps) a zásady správného řízení. MLOps Stacks poskytuje šablony pro povolení automatizovaného opakovatelného povýšení z vývoje do produkčního prostředí pomocí infrastruktury jako kódu. Data, funkce, modely a koncové body se plně řídí katalogem Unity a službou AI Gateway.
| Category | Features |
|---|---|
| CI/CD pro strojové učení | Sady MLOps, postavené na deklarativních balíčcích automatizace, umožňují správu a nasazování infrastruktury a pracovních postupů strojového učení prostřednictvím kódu. To zahrnuje šablony CI/CD pro automatizaci trénování, vyhodnocení a nasazení. |
| Orchestrace pracovních postupů | Úlohy Lakeflow orchestrují vícekrokové pracovní postupy ML jako naplánované nebo aktivované kanály. |
| Zásady správného řízení prostředků dat a modelů | Katalog Unity poskytuje jednotné zásady správného řízení pro data, funkce a registrované modely. Podrobné řízení přístupu, sledování rodokmenu a protokoly auditu se vztahují na všechny prostředky. |
| Zásady správného řízení koncových bodů modelu | AI Gateway poskytuje centralizované zásady správného řízení a monitorování pro koncové body modelu, včetně omezení rychlosti, sledování využití a protokolování datové části. |
Podpora open source
Azure Databricks poskytuje plnou podporu pro opensourcový ekosystém ML.
Na Azure Databricks můžete použít libovolnou opensourcovou architekturu ML: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray a další. MLflow nebo vlastní nástroje můžou ukládat artefakty modelu v otevřených formátech, které je možné exportovat a spouštět mimo Azure Databricks.
MLflow je opensourcový, vytvořený Azure Databricks a používá 10 000 organizací a více. Data o sledování experimentů, artefakty modelu a definice pipeline se ukládají v otevřených formátech.
Zásady správného řízení dat a AI vycházejí z opensourcových rozhraní API katalogu Unity a úložiště dat vychází z otevřeného formátu Delta Lake . Vaše data funkcí a trénovací datové sady zůstávají v otevřených přenosných souborech.