Kommentar
Åtkomst till den här sidan kräver auktorisering. Du kan prova att logga in eller ändra kataloger.
Åtkomst till den här sidan kräver auktorisering. Du kan prova att ändra kataloger.
Datavetenskap och maskininlärning (DS och ML) extraherar insikter och skapar förutsägelsemodeller från data. DS och ML omfattar både interaktiva utforsknings- och modelleringssystem och automatiserade produktionssystem. Klassisk ML innehåller tekniker som klassificering, regression, avvikelseidentifiering, prognostisering och rekommendation.
Moderna metoder för djupinlärning och generativ AI (GenAI) är tekniskt sett typer av ML. Det här avsnittet beskriver djupinlärning. För GenAI, se Begrepp: Generativ AI på Azure Databricks.
ML-livscykeln
ML-livscykeln omfattar hela processen från rådata till en produktionsmodell och tillbaka igen via övervakning och omträning. Viktiga steg är:
- Omfång för användningsfallet genom att definiera förutsägelsemålet, framgångsmåtten och produktionskraven.
- Kör undersökande dataanalys (EDA) för att förstå datadistributioner, förutsägande signaler och datakvalitetsproblem före modellering.
- Förbereda data och funktioner som hanteras i ett funktionslager.
- Träna modeller och spåra experiment, logga experimentmetadata för analys och distribution.
- Utvärdera modellkvaliteten utifrån testdata och intressenters kriterier.
- Registrera, mellanlagra och testa modeller innan du befordrar till produktion.
- Driftsätt i produktion på realtidsslutpunkter eller batchjobb för inferens.
- Övervaka och träna om för att anpassa modeller till att ändra data eller användarbeteende.
En guide till varje steg finns i Livscykel för maskininlärning .
AI-assisterad utveckling och drift
Azure Databricks har Genie Code, en AI-assistent som är integrerad i hela anteckningsböckerna och arbetsytan. Använd den för utveckling, felsökning och pågående åtgärder, med hjälp av dess specialiserade kunskaper om din företagskontext. Se Använda Genie Code för datavetenskap.
Du kan använda Genie Code i varje steg i arbetsflödet:
- Börja med Genie-chatten för att identifiera relevanta modeller, data och funktioner i din arbetsyta och Unity Catalog.
- Använd Genie Code för att skapa prototyper för pipelines för funktionalisering, modellträning och justering, utvärdering och distribution.
- Analysera slutpunkter för modellservering med Genie Code för att diagnostisera och undersöka problem i produktionsmiljö.
Du kan också använda kodningsverktyg från tredje part för att utveckla och underhålla ML-pipelines på Azure Databricks. Se Agentkunskaper för AI-kodningsassistenter.
Vad är en ML-plattform?
En ML-plattform är det kombinerade infrastruktur-, verktygs- och styrningslagret som stöder hela ML-livscykeln, från rådata till produktionsmodeller. En väldesignad ML-plattform ansluter datateknik, interaktiv datavetenskap och produktions-ML i ett enda styrt system.
Viktiga komponenter är:
- Dataresurser som filer, tabeller, bearbetningskedjor och funktionsdatabaser
- Experimenteringsverktyg som notebook-filer och visualiseringar, med enkelt samarbete och AI-hjälp
- Utbildningsinfrastruktur med anpassningsbara miljöer och flexibla beräkningsresurser
- Infrastruktur för driftsättning och övervakning för batch- och realtidsleverans, med produktionsdashboards och aviseringar
- MLOps och verktyg för styrning för orkestrering, CI/CD, spårbarhet, åtkomsthantering och revisionsloggning
Viktiga styrningsfunktioner är:
- Enhetlig styrning av data och ML-tillgångar. Läs mer i Vad är Unity Catalog?.
- Enhetlig styrning av modellslutpunkter. Läs mer i AI Gateway för serverslutpunkter.
- Enhetlig säkerhetsmetod. Läs mer på Databricks AI Security.
- Enhetlig administration av data och ML-verktyg. Läs mer i Administration.
Se även Azure Databricks datavetenskap och ML-funktioner och Azure Databricks arkitektur.
ML jämfört med djupinlärning jämfört med GenAI
Gränserna mellan maskininlärning (ML), djupinlärning (DL) och generativ AI (GenAI) kan vara suddiga. Den här guiden fokuserar på ML och djupinlärning, men följande plattformsfunktioner stöder alla tre paradigmen:
- Model Serving stöder klassiska ML-, djupinlärnings- och anpassade GenAI-modeller för både realtids- och batchinferens.
-
ai_querystöder SQL-frågor och batchinferensarbetsbelastningar för alla tre paradigmen.
- AI Runtime och GPU-aktiverade Databricks Runtime för strojové učenie stöder träning och finjustering i alla tre paradigmen.
- MLflow-experimentspårning spårar körningar och experiment för alla tre paradigmen.
- Databricks AI Search hanterar ostrukturerade data för alla tre paradigmen.
Ytterligare resurser
- Livscykel för maskininlärning – LIVSCYKELfaser och metodtips för ML
- Azure Databricks datavetenskaps- och ML-funktioner – Azure Databricks ML-funktioner efter arbetsflödessteg
- AI på Databricks – Användningsfall, kunder och andra resurser