Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Azure Databricks har en enhetlig plattform för hela livscykeln för datavetenskap (DS) och maskininlärning (ML), från rådatainmatning via funktionsutveckling, modellträning, distribution och produktionsövervakning. Azure Databricks integreras med populära ML-ramverk med öppen källkod och lägger till styrning i företagsklass, observerbarhet och operativa verktyg, som tillsammans kallas MLOps.
På den här sidan visas större DS- och ML-funktioner, ordnade efter arbetsflödessteg.
Undersökande dataanalys
Azure Databricks förenklar undersökande dataanalys (EDA) genom att tillhandahålla interaktiva, samarbetsinriktade och AI-assisterade verktyg för dataforskare. Dataexperter kan utforska data med hjälp av chatt med naturligt språk, UIs eller kod, och de kan samarbeta med hjälp av både samredigering i realtid och Git-baserad koddelning. Genie Code kan utföra helt automatiserad EDA eller fungera som en interaktiv assistent.
| Category | Features |
|---|---|
| Användargränssnitt |
|
| Samarbete |
|
| AI-assistenter |
|
Förbereda och leverera funktioner
Azure Databricks förenklar data för ML genom att förena styrning av data och ML-arbetsbelastningar. Med alla data som hanteras under Unity Catalog med detaljerade åtkomstkontroller kan du justera datateknik och ML-gränser så att de passar din organisation. Data kan förberedas för ML med hjälp av datateknikverktyg som Lakeflow-pipelines. Funktioner hanteras i ett funktionslager för både batch- och realtidsservering, med en enda, styrd sanningskälla för funktioner.
Genie Code påskyndar dataidentifiering och förberedelse genom att bläddra i Unity Catalog för att identifiera relevanta tabeller, föreslå funktionsomvandlingar och generera kod för inmatning och funktionspipelines.
| Funktionstyp | Features |
|---|---|
| Batch-funktioner |
|
| Realtidsfunktioner |
|
| Ostrukturerade data | MED AI Search kan du hantera ostrukturerade data och köra semantisk sökning. |
Träna ML-modeller
Azure Databricks har flexibla verktyg för att träna ML- och djupinlärningsmodeller. Med förkonfigurerade och anpassningsbara miljöer kan du använda anpassade ML-bibliotek, och serverlösa processor- och GPU-accelererade beräkningsresurser gör det möjligt att skala upp och skala ut på begäran. Genie Code tillhandahåller intelligent AutoML, tar begäranden om naturligt språk och skapar fullständiga arbetsflöden för flera notebook-filer för funktionalisering, träning, justering, utvärdering och distribution.
| Category | Features |
|---|---|
| Typer av ML | Azure Databricks stöder alla typer av ML, inklusive:
För generativ AI, se Azure Databricks generativa AI-funktioner. |
| Compute |
|
| Miljöer och bibliotek |
|
| AI-kodningsassistenter |
|
Spåra och hantera experiment
Azure Databricks hanterad MLflow utgör grunden för reproducerbar, granskningsbar ML-utveckling. Dess integreringar med Unity Catalog och Git ger spårning och ursprung för data och kodtillgångar. Varje modellversion i registret länkar tillbaka till den träningskörning, den datauppsättning, den miljö och den Git-commit som skapade den, vilket ger ett fullständigt granskningsspår för varje driftsatt modell.
| Category | Features |
|---|---|
| Experimentspårning | MLflow-spårning loggar parametrar, mätvärden och artefakter för varje träningskörning. Jämför körningar i MLflow-användargränssnittet för att identifiera den bäst presterande konfigurationen. |
| Modellregister |
Modeller i Unity Catalog tillhandahåller ett MLflow-modellregister integrerat med Unity Catalog. Versionshanterade modellartefakter styrs med livscykelalias (Staging, Production), åtkomstkontroll, ursprung och delning mellan arbetsytor. |
| Reproducerbarhet | Anteckningsböcker och kod kan versionshanteras med Databricks Git-mappar och integreras med valfri Git-leverantör. |
Distribuera och hantera modeller
Azure Databricks stöder både batchinferens och realtidsservering. Batch-slutsatsdragning tillämpar modeller effektivt på stora datauppsättningar, medan realtidsservern tillhandahåller modeller som API-slutpunkter med låg latens. Genie Code kan både generera kod för modelldistribution och diagnostisera problem och prestanda för modell som betjänar slutpunkter.
| Serveringsmönster | Features |
|---|---|
| Batch-slutsatsdragning |
|
| Servering i realtid | Modellservering ger hanterade REST-slutpunkter med låg latens och hög drifttid med serverlös automatisk skalning. Detta stöder PROCESSOR- och GPU-servering för alla ML-ramverk, och du kan använda Genie för att utvärdera och felsöka serverdelsslutpunkter. |
| SQL-intern slutsatsdragning |
|
Utvärdera och övervaka
Azure Databricks ger flexibel utvärdering för utbildning och kontinuerlig övervakning för produktion. Loggar i realtid för inferenstabeller som hanteras i Unity Catalog, och datakvalitetsövervakning erbjuder övervakning med anpassade mätvärden, dashboards och aviseringar.
| Category | Features |
|---|---|
| Evaluation |
|
| Loggning av prediktioner | Inference Tables loggar förfrågningar och svar vid modellservering, vilket möjliggör övervakning, analys och uppbyggnad av träningsdatamängder. |
| Övervakning och aviseringar |
|
MLOps och styrning
Azure Databricks tillhandahåller en fullständig uppsättning verktyg för ML-åtgärder (MLOps) och styrning. MLOps Stacks innehåller mallar för att aktivera automatiserad, repeterbar befordran från utveckling till produktion med hjälp av infrastruktur som kod. Data, funktioner, modeller och slutpunkter styrs helt av Unity Catalog och AI Gateway.
| Category | Features |
|---|---|
| CI/CD för ML | MLOps Stacks, som bygger på deklarativa automationspaket, tillhandahåller kodbaserad hantering och distribution av ML-infrastruktur och arbetsflöden. Detta inkluderar CI/CD-mallar för att automatisera utbildning, utvärdering och distribution. |
| Arbetsflödesorkestrering | Lakeflow Jobs orkestrerar ML-arbetsflöden i flera steg som schemalagda eller utlösta pipelines. |
| Styrning av data och modelltillgångar | Unity Catalog ger enhetlig styrning för data, funktioner och registrerade modeller. Detaljerade åtkomstkontroller, ursprungsspårning och granskningsloggar gäller för alla tillgångar. |
| Styrning av modellslutpunkter | AI Gateway tillhandahåller centraliserad styrning och övervakning för modellslutpunkter, inklusive hastighetsbegränsningar, användningsspårning och nyttolastloggning. |
Stöd för öppen källkod
Azure Databricks ger fullständigt stöd för ML-ekosystemet med öppen källkod.
Du kan använda valfritt ML-ramverk med öppen källkod på Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray med mera. MLflow eller dina anpassade verktyg kan lagra modellartefakter i öppna format som kan exporteras och köras utanför Azure Databricks.
MLflow är öppen källkod, skapat av Azure Databricks och används av över 10 000 organisationer. Experimentspårningsdata, modellartefakter och pipelinedefinitioner lagras i öppna format.
Data- och AI-styrning bygger på API:er för Unity Catalog med öppen källkod och datalagring baseras på det öppna Delta Lake-formatet . Dina funktionsdata och träningsdatauppsättningar förblir i öppna, portabla filer.