Azure Databricks datavetenskaps- och ML-funktioner

Azure Databricks har en enhetlig plattform för hela livscykeln för datavetenskap (DS) och maskininlärning (ML), från rådatainmatning via funktionsutveckling, modellträning, distribution och produktionsövervakning. Azure Databricks integreras med populära ML-ramverk med öppen källkod och lägger till styrning i företagsklass, observerbarhet och operativa verktyg, som tillsammans kallas MLOps.

På den här sidan visas större DS- och ML-funktioner, ordnade efter arbetsflödessteg.

Undersökande dataanalys

Azure Databricks förenklar undersökande dataanalys (EDA) genom att tillhandahålla interaktiva, samarbetsinriktade och AI-assisterade verktyg för dataforskare. Dataexperter kan utforska data med hjälp av chatt med naturligt språk, UIs eller kod, och de kan samarbeta med hjälp av både samredigering i realtid och Git-baserad koddelning. Genie Code kan utföra helt automatiserad EDA eller fungera som en interaktiv assistent.

Category Features
Användargränssnitt
  • Anteckningsböcker erbjuder samarbetsytor för utforskning, visualisering och dokumentation för EDA.
  • Instrumentpaneler tillhandahåller SQL- och visualiseringsbaserad EDA.
  • Genie Chat har ett naturligt språkgränssnitt för att ställa datafrågor.
Samarbete
AI-assistenter

Förbereda och leverera funktioner

Azure Databricks förenklar data för ML genom att förena styrning av data och ML-arbetsbelastningar. Med alla data som hanteras under Unity Catalog med detaljerade åtkomstkontroller kan du justera datateknik och ML-gränser så att de passar din organisation. Data kan förberedas för ML med hjälp av datateknikverktyg som Lakeflow-pipelines. Funktioner hanteras i ett funktionslager för både batch- och realtidsservering, med en enda, styrd sanningskälla för funktioner.

Genie Code påskyndar dataidentifiering och förberedelse genom att bläddra i Unity Catalog för att identifiera relevanta tabeller, föreslå funktionsomvandlingar och generera kod för inmatning och funktionspipelines.

Funktionstyp Features
Batch-funktioner
  • Featuretabeller i Unity Catalog lagrar förberäknade batchfunktioner med automatisk datalineage och styrning. Team upptäcker och återanvänder befintlig funktionalitet i stället för att bygga om pipelines från grunden.
  • Funktionsvyer tillhandahåller ett nytt API för att definiera funktioner som sedan kan användas för batch- eller realtidsfunktionsberäkning.
Realtidsfunktioner
  • För förberäknade funktioner kan onlinefunktionsbutiker hantera funktionstabeller för realtidsmodell som betjänar användningsfall.
  • När funktionaliseringsindata endast är tillgängliga vid serveringstid har funktionsservern funktionsberäkning på begäran som komplement till funktionstabeller. Egenskaper definieras som funktioner i stället för som förberäknade värden.
  • Funktionsvyer tillhandahåller ett nytt API för att definiera funktioner som sedan kan användas för batch- eller realtidsfunktionsberäkning.
Ostrukturerade data MED AI Search kan du hantera ostrukturerade data och köra semantisk sökning.

Träna ML-modeller

Azure Databricks har flexibla verktyg för att träna ML- och djupinlärningsmodeller. Med förkonfigurerade och anpassningsbara miljöer kan du använda anpassade ML-bibliotek, och serverlösa processor- och GPU-accelererade beräkningsresurser gör det möjligt att skala upp och skala ut på begäran. Genie Code tillhandahåller intelligent AutoML, tar begäranden om naturligt språk och skapar fullständiga arbetsflöden för flera notebook-filer för funktionalisering, träning, justering, utvärdering och distribution.

Category Features
Typer av ML Azure Databricks stöder alla typer av ML, inklusive:
  • Klassisk ML: Övervakad och oövervakad inlärning med scikit-learn, XGBoost, LightGBM, Apache Spark MLlib och andra ML-ramverk
  • Djupinlärning: Neural nätverksträning med PyTorch, TensorFlow och Hugging Face Transformers, inklusive distribuerad träning över flera GPU:er
  • Justering av hyperparametrar: Automatiserad sökning mellan algoritm- och hyperparameterutrymmen med verktyg som Optuna och Ray

För generativ AI, se Azure Databricks generativa AI-funktioner.
Compute
  • Serverlös beräkning startar direkt för interaktiva notebook-filer och schemalagda arbetsflöden, med automatisk skalning och ingen klusterhantering. Den stöder både CPU- och GPU-accelererade kluster.
  • Klassisk beräkning har hantering av en dator och kluster för både CPU- och GPU-arbetsbelastningar.
Miljöer och bibliotek
  • Serverlösa beräkningsmiljöer tillhandahåller basmiljöer som kan anpassas helt för ML. För serverlös GPU-beräkning tillhandahåller AI Runtime miljöer som är förkonfigurerade för GPU-baserad träning och slutsatsdragning.
  • För klassisk beräkning tillhandahåller Databricks Runtime för strojové učenie förkonfigurerade klustermiljöer med större ML-bibliotek förinstallerade och testade tillsammans för både CPU- och GPU-accelererade kluster.
AI-kodningsassistenter

Spåra och hantera experiment

Azure Databricks hanterad MLflow utgör grunden för reproducerbar, granskningsbar ML-utveckling. Dess integreringar med Unity Catalog och Git ger spårning och ursprung för data och kodtillgångar. Varje modellversion i registret länkar tillbaka till den träningskörning, den datauppsättning, den miljö och den Git-commit som skapade den, vilket ger ett fullständigt granskningsspår för varje driftsatt modell.

Category Features
Experimentspårning MLflow-spårning loggar parametrar, mätvärden och artefakter för varje träningskörning. Jämför körningar i MLflow-användargränssnittet för att identifiera den bäst presterande konfigurationen.
Modellregister Modeller i Unity Catalog tillhandahåller ett MLflow-modellregister integrerat med Unity Catalog. Versionshanterade modellartefakter styrs med livscykelalias (Staging, Production), åtkomstkontroll, ursprung och delning mellan arbetsytor.
Reproducerbarhet Anteckningsböcker och kod kan versionshanteras med Databricks Git-mappar och integreras med valfri Git-leverantör.

Distribuera och hantera modeller

Azure Databricks stöder både batchinferens och realtidsservering. Batch-slutsatsdragning tillämpar modeller effektivt på stora datauppsättningar, medan realtidsservern tillhandahåller modeller som API-slutpunkter med låg latens. Genie Code kan både generera kod för modelldistribution och diagnostisera problem och prestanda för modell som betjänar slutpunkter.

Serveringsmönster Features
Batch-slutsatsdragning
Servering i realtid Modellservering ger hanterade REST-slutpunkter med låg latens och hög drifttid med serverlös automatisk skalning. Detta stöder PROCESSOR- och GPU-servering för alla ML-ramverk, och du kan använda Genie för att utvärdera och felsöka serverdelsslutpunkter.
SQL-intern slutsatsdragning
  • AI-funktioner ger SQL-tillgängliga ML-förutsägelser för prognostisering, avvikelseidentifiering och drivrutinsanalys, utan Python eller modelldistribution krävs.
  • För anpassade modeller ger AI-funktionen ai_query effektiv batchinferens som backas upp av modellserverns slutpunkter.

Utvärdera och övervaka

Azure Databricks ger flexibel utvärdering för utbildning och kontinuerlig övervakning för produktion. Loggar i realtid för inferenstabeller som hanteras i Unity Catalog, och datakvalitetsövervakning erbjuder övervakning med anpassade mätvärden, dashboards och aviseringar.

Category Features
Evaluation
Loggning av prediktioner Inference Tables loggar förfrågningar och svar vid modellservering, vilket möjliggör övervakning, analys och uppbyggnad av träningsdatamängder.
Övervakning och aviseringar

MLOps och styrning

Azure Databricks tillhandahåller en fullständig uppsättning verktyg för ML-åtgärder (MLOps) och styrning. MLOps Stacks innehåller mallar för att aktivera automatiserad, repeterbar befordran från utveckling till produktion med hjälp av infrastruktur som kod. Data, funktioner, modeller och slutpunkter styrs helt av Unity Catalog och AI Gateway.

Category Features
CI/CD för ML MLOps Stacks, som bygger på deklarativa automationspaket, tillhandahåller kodbaserad hantering och distribution av ML-infrastruktur och arbetsflöden. Detta inkluderar CI/CD-mallar för att automatisera utbildning, utvärdering och distribution.
Arbetsflödesorkestrering Lakeflow Jobs orkestrerar ML-arbetsflöden i flera steg som schemalagda eller utlösta pipelines.
Styrning av data och modelltillgångar Unity Catalog ger enhetlig styrning för data, funktioner och registrerade modeller. Detaljerade åtkomstkontroller, ursprungsspårning och granskningsloggar gäller för alla tillgångar.
Styrning av modellslutpunkter AI Gateway tillhandahåller centraliserad styrning och övervakning för modellslutpunkter, inklusive hastighetsbegränsningar, användningsspårning och nyttolastloggning.

Stöd för öppen källkod

Azure Databricks ger fullständigt stöd för ML-ekosystemet med öppen källkod.

Du kan använda valfritt ML-ramverk med öppen källkod på Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray med mera. MLflow eller dina anpassade verktyg kan lagra modellartefakter i öppna format som kan exporteras och köras utanför Azure Databricks.

MLflow är öppen källkod, skapat av Azure Databricks och används av över 10 000 organisationer. Experimentspårningsdata, modellartefakter och pipelinedefinitioner lagras i öppna format.

Data- och AI-styrning bygger på API:er för Unity Catalog med öppen källkod och datalagring baseras på det öppna Delta Lake-formatet . Dina funktionsdata och träningsdatauppsättningar förblir i öppna, portabla filer.

Ytterligare resurser