Koncepty: Datové vědy a strojové učení na Azure Databricks

Datové vědy a strojové učení (DS a ML) extrahují přehledy a vytvářejí prediktivní modely z dat. DS a ML zahrnují interaktivní průzkum a modelování a automatizované produkční systémy. Klasické strojové učení zahrnuje techniky, jako je klasifikace, regrese, detekce anomálií, prognózování a doporučení.

Moderní metody hlubokého učení a generování umělé inteligence (GenAI) jsou technicky typy ML. Tato část se věnuje hlubokému učení. Informace o GenAI najdete v tématu Koncepty: Generování umělé inteligence na Azure Databricks.

Životní cyklus ML

Životní cyklus ML zahrnuje kompletní cestu z nezpracovaných dat do produkčního modelu a znovu prostřednictvím monitorování a opětovného trénování. Mezi klíčové fáze patří:

  1. Rozsah případu použití definováním cíle předpovědi, metrik úspěchu a produkčních požadavků.
  2. Před modelováním spusťte průzkumnou analýzu dat (EDA), abyste porozuměli distribucím dat, prediktivním signálům a problémům s kvalitou dat.
  3. Příprava dat a funkcí spravovaných v úložišti funkcí
  4. Trénujte modely a sledujte experimenty, protokolování metadat experimentů pro analýzu a nasazení.
  5. Vyhodnoťte kvalitu modelu proti uchovávaným datům a kritériím účastníků.
  6. Před povýšením do produkčního prostředí zaregistrujte, připravte a otestujte modely.
  7. Nasaďte do produkčního prostředí na koncové body v reálném čase nebo do úloh dávkové inference.
  8. Monitorujte a přetrénujte, abyste přizpůsobili modely změnám dat nebo chování uživatelů.

Informace o životním cyklu strojového učení najdete v průvodci jednotlivými fázemi.

Vývoj a provoz s asistencí umělé inteligence

Azure Databricks má Genie Code, asistent umělé inteligence integrovaný napříč poznámkovými bloky a pracovním prostorem. Můžete ho použít pro vývoj, ladění a průběžné operace, které vycházejí ze specializovaných znalostí vašeho podnikového kontextu. Viz Použití kódu Genie pro datové vědy.

Genie Code můžete použít v každém kroku pracovního postupu:

K vývoji a správě kanálů ML na Azure Databricks můžete také použít nástroje pro kódování třetích stran. Podívejte se na dovednosti agenta pro asistenty AI pro kódování.

Co je platforma ML?

Platforma ML je kombinovaná infrastruktura, nástroje a vrstva zásad správného řízení, která podporuje celý životní cyklus ML od nezpracovaných dat až po produkční modely. Dobře navržená platforma ML spojuje datové inženýrství, interaktivní datové vědy a produkční strojové učení v jednom řízeném systému.

Mezi klíčové komponenty patří:

  • Datové prostředky, jako jsou soubory, tabulky, kanály zpracování a úložiště funkcí
  • Nástroje pro experimentování, jako jsou notebooky a vizualizace, se snadnou spoluprací a asistencí AI
  • Trénovací infrastruktura s přizpůsobitelnými prostředími a flexibilními výpočetními prostředky
  • Infrastruktura pro nasazení a monitorování dávkového i zpracování v reálném čase, s produkčními dashboardy a upozorněními
  • MLOps a nástroje zásad správného řízení pro orchestraci, CI/CD, rodokmen, správu přístupu a protokolování auditu

Mezi klíčové možnosti zásad správného řízení patří:

Viz také možnosti Azure Databricks datových věd a strojového učení a architekturu Azure Databricks.

ML vs. hluboké učení vs. GenAI

Hranice strojového učení (ML), hlubokého učení (DL) a generování AI (GenAI) můžou být přibližné. Tato příručka se zaměřuje na strojové učení a hluboké učení, ale následující funkce platformy podporují všechna tři paradigmata:

  • Obsluha modelů podporuje klasické modely ML, hluboké učení a vlastní modely GenAI pro odvozování v reálném čase i dávkové odvozování.
  • ai_query podporuje dotazy SQL a úlohy dávkového odvozování pro všechna tři paradigmata.
  • Modul Databricks Runtime s podporou AI a GPU pro Machine Learning podporují trénování a vyladění napříč všemi třemi paradigmaty.

Další zdroje informací