Možnosti Azure Databricks pro datovou vědu a strojové učení

Azure Databricks má jednotnou platformu pro úplný životní cyklus datových věd (DS) a strojového učení (ML) od nezpracovaného příjmu dat prostřednictvím přípravy funkcí, trénování modelů, nasazení a monitorování produkce. Azure Databricks se integruje s oblíbenými opensourcovými architekturami ML, přidáním zásad správného řízení na podnikové úrovni, pozorovatelnosti a provozních nástrojů, které se souhrnně označují jako MLOps.

Tato stránka obsahuje hlavní možnosti DS a ML uspořádané podle dílčí fáze pracovního postupu.

Průzkumná analýza dat

Azure Databricks zjednodušuje průzkumnou analýzu dat (EDA) tím, že poskytuje interaktivní, spolupráci a nástroje asistované umělé inteligence pro datové vědce. Datoví vědci můžou zkoumat data pomocí chatu v přirozeném jazyce, uživatelských rozhraní nebo kódu a mohou spolupracovat pomocí spoluvytváření v reálném čase i sdílení kódu založeného na Gitu. Genie Code může plně automatizovat EDA nebo pracovat jako interaktivní asistent.

Category Features
Uživatelské rozhraní
  • Poznámkové bloky poskytují prostory pro spolupráci pro zkoumání, vizualizaci a dokumentaci pro EDA.
  • Řídicí panely poskytují EDA založené na SQL a vizualizacích.
  • Genie Chat má rozhraní přirozeného jazyka pro kladení otázek na data.
Collaboration
Asistenti umělé inteligence

Příprava a obsluha funkcí

Azure Databricks zjednodušuje data pro ML sjednocením zásad správného řízení úloh dat a ML. Se všemi daty spravovanými v katalogu Unity s jemně odstupňovanými ovládacími prvky přístupu můžete upravit datové inženýrství a hranice ML tak, aby vyhovovaly vaší organizaci. Data je možné připravit na STROJOVÉ učení pomocí libovolných nástrojů pro přípravu dat , jako jsou kanály Lakeflow. Příznaky se spravují v Feature Store pro dávkové poskytování i poskytování v reálném čase, přičemž pro příznaky slouží jako jediný spravovaný zdroj pravdy.

Genie Code zrychluje zjišťování a přípravu dat procházením katalogu Unity a zjišťuje relevantní tabulky, navrhuje transformace funkcí a generuje kód pro příjem dat a kanály funkcí.

Typ funkce Features
Funkce služby Batch
  • Tabulky funkcí v katalogu Unity ukládají předem připravené dávkové funkce s automatickým rodokmenem a zásadami správného řízení. Týmy objevují a znovu využívají stávající funkcionality, místo aby od základu znovu vytvářely kanály.
  • Feature Views poskytují nové rozhraní API pro definování atributů, které lze následně použít pro dávkový výpočet atributů nebo jejich výpočet v reálném čase.
Funkce v reálném čase
  • Pro předpočítané příznaky slouží online úložiště příznaků k poskytování tabulek příznaků pro případy použití modelů v reálném čase.
  • Pokud jsou vstupy pro featurizaci k dispozici pouze při obsluze požadavku, feature serving umožňuje výpočet příznaků na vyžádání jako doplněk k tabulkám příznaků. Funkcionality jsou definovány jako funkce, nikoli jako předem vypočítané hodnoty.
  • Feature Views poskytují nové rozhraní API pro definování atributů, které lze následně použít pro dávkový výpočet atributů nebo jejich výpočet v reálném čase.
Nestrukturovaná data AI Search umožňuje obsluhovat nestrukturovaná data a sémantické vyhledávání.

Trénování modelů ML

Azure Databricks nabízí flexibilní nástroje pro trénování modelů strojového učení a hlubokého učení. Předem nakonfigurovaná a přizpůsobitelná prostředí umožňují používat vlastní knihovny ML a bezserverové výpočetní prostředky a výpočetní prostředky s akcelerovanými gpu umožňují vertikální navýšení a horizontální navýšení kapacity na vyžádání. Genie Code poskytuje inteligentní AutoML, který přijímá požadavky přirozeného jazyka a vytváří kompletní pracovní postupy s více poznámkovými bloky pro featurizaci, trénování, ladění, hodnocení a nasazení.

Category Features
Typy strojového učení Azure Databricks podporuje všechny typy ML, včetně:
  • Klasické strojové učení: Učení pod dohledem a bez dohledu s využitím scikit-learn, XGBoost, LightGBM, Apache Spark MLlib a dalších architektur ML
  • Hluboké učení: Trénování neurální sítě s využitím PyTorchu, TensorFlow a Hugging Face Transformers, včetně distribuovaného trénování napříč několika gpu
  • Ladění hyperparametrů: Automatizované vyhledávání v algoritmech a prostorech hyperparametrů pomocí nástrojů, jako je Optuna a Ray

Informace o generování umělé inteligence najdete v tématu Azure Databricks možnosti generování umělé inteligence.
Compute
Prostředí a knihovny
  • Bezserverová výpočetní prostředí poskytují základní prostředí, která je možné plně přizpůsobit pro ML. Pro výpočetní prostředí GPU bez serveru poskytuje modul runtime AI předkonfigurovaná prostředí pro trénování a odvozování na základě GPU.
  • Pro klasické výpočetní prostředky poskytuje Databricks Runtime pro Machine Learning předem nakonfigurovaná clusterová prostředí s předinstalovanými a otestovanými hlavními knihovnami ML pro clustery s akcelerovanými procesory i GPU.
AI asistenti pro programování

Sledování a správa experimentů

Azure Databricks spravované MLflow poskytuje základ pro reprodukovatelný a auditovatelný vývoj ML. Jeho integrace s Unity Catalog a Gitem umožňují sledování a dohledání původu datových a kódových prostředků. Každá verze modelu v registru odkazuje zpět na trénovací běh, datovou sadu, prostředí a potvrzení Gitu, které ho vytvořilo, a poskytuje kompletní záznam auditu pro libovolný nasazený model.

Category Features
Sledování experimentů MLflow tracking zaznamenává parametry, metriky a artefakty pro každý trénovací běh. Porovnejte spuštění v uživatelském rozhraní MLflow a identifikujte tak konfiguraci s nejlepším výkonem.
Rejstřík modelů Modely v katalogu Unity poskytují registr modelů MLflow integrovaný s katalogem Unity. Verzované artefakty modelu jsou spravovány pomocí aliasů životního cyklu (Staging, Production), řízení přístupu, sledování původu a sdílení mezi pracovními oblastmi.
Reprodukovatelnost Poznámkové bloky a kód lze verzovat pomocí složek Databricks Git a integrovat s libovolným poskytovatelem Git.

Nasazení a obsluha modelů

Azure Databricks podporuje dávkové odvozování i obsluhu v reálném čase. Dávková inference efektivně aplikuje modely na velké datové sady, zatímco nasazení v reálném čase zpřístupňuje modely prostřednictvím API endpointů s nízkou latencí. Genie Code může generovat kód pro nasazení modelu a diagnostikovat problémy a výkon pro koncové body obsluhy modelu.

Způsob poskytování Features
Dávkové odvozování
Obsluha v reálném čase Poskytování modelů poskytuje koncové body REST spravované bezserverovým automatickým škálováním s nízkou latencí a vysokou dostupností. To podporuje využití procesoru a GPU pro libovolnou architekturu ML a pomocí Genie můžete vyhodnotit koncové body a řešit potíže s obsluhou koncových bodů.
SQL‑nativní inferování

Vyhodnocení a monitorování

Azure Databricks poskytuje flexibilní vyhodnocení pro trénování a průběžné monitorování pro produkční prostředí. Protokoly obsluhy v reálném čase do inferenčních tabulek spravovaných v Unity Catalog a monitorování kvality dat umožňují monitorování pomocí vlastních metrik, řídicích panelů a upozornění.

Category Features
Evaluation
Protokolování předpovědí Tabulky inferencí zaznamenávají požadavky a odpovědi při obsluze, což umožňuje monitorování, analýzy a vytváření trénovacích datových sad.
Monitorování a upozornění

MLOps a zásady správného řízení

Azure Databricks poskytuje úplnou sadu nástrojů pro operace ML (MLOps) a zásady správného řízení. MLOps Stacks poskytuje šablony pro povolení automatizovaného opakovatelného povýšení z vývoje do produkčního prostředí pomocí infrastruktury jako kódu. Data, funkce, modely a koncové body se plně řídí katalogem Unity a službou AI Gateway.

Category Features
CI/CD pro strojové učení Sady MLOps, postavené na deklarativních balíčcích automatizace, umožňují správu a nasazování infrastruktury a pracovních postupů strojového učení prostřednictvím kódu. To zahrnuje šablony CI/CD pro automatizaci trénování, vyhodnocení a nasazení.
Orchestrace pracovních postupů Úlohy Lakeflow orchestrují vícekrokové pracovní postupy ML jako naplánované nebo aktivované kanály.
Zásady správného řízení prostředků dat a modelů Katalog Unity poskytuje jednotné zásady správného řízení pro data, funkce a registrované modely. Podrobné řízení přístupu, sledování rodokmenu a protokoly auditu se vztahují na všechny prostředky.
Zásady správného řízení koncových bodů modelu AI Gateway poskytuje centralizované zásady správného řízení a monitorování pro koncové body modelu, včetně omezení rychlosti, sledování využití a protokolování datové části.

Podpora open source

Azure Databricks poskytuje plnou podporu pro opensourcový ekosystém ML.

Na Azure Databricks můžete použít libovolnou opensourcovou architekturu ML: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray a další. MLflow nebo vlastní nástroje můžou ukládat artefakty modelu v otevřených formátech, které je možné exportovat a spouštět mimo Azure Databricks.

MLflow je opensourcový, vytvořený Azure Databricks a používá 10 000 organizací a více. Data o sledování experimentů, artefakty modelu a definice pipeline se ukládají v otevřených formátech.

Zásady správného řízení dat a AI vycházejí z opensourcových rozhraní API katalogu Unity a úložiště dat vychází z otevřeného formátu Delta Lake . Vaše data funkcí a trénovací datové sady zůstávají v otevřených přenosných souborech.

Další zdroje informací