Nota
O acesso a esta página requer autorização. Pode tentar iniciar sessão ou alterar os diretórios.
O acesso a esta página requer autorização. Pode tentar alterar os diretórios.
O Azure Databricks tem uma plataforma unificada para todo o ciclo de vida da ciência de dados (DS) e do machine learning (ML), desde a ingestão de dados brutos até à engenharia de funcionalidades, treino de modelos, implementação e monitorização de produção. O Azure Databricks integra-se com frameworks populares de ML open-source, adicionando governação de nível empresarial, observabilidade e ferramentas operacionais, coletivamente conhecidas como MLOps.
Esta página lista as principais capacidades de DS e ML, organizadas por fase do fluxo de trabalho.
Análise exploratória de dados
O Azure Databricks simplifica a análise exploratória de dados (EDA) ao fornecer ferramentas interativas, colaborativas e assistidas por IA para cientistas de dados. Cientistas de dados podem explorar dados usando chat em linguagem natural, interfaces ou código, e podem colaborar tanto através de co-edição em tempo real como de partilha de código baseada em Git. O Genie Code pode fazer EDA totalmente automatizado ou atuar como assistente interativo.
| Categoria | Features |
|---|---|
| Interface de utilizador |
|
| Collaboration |
|
| Assistentes de IA |
|
Características de preparação e serviço
O Azure Databricks simplifica os dados para ML ao unificar a governação dos dados e das cargas de trabalho de ML. Com todos os dados geridos no Unity Catalog com controlos de acesso detalhados, pode ajustar os limites da engenharia de dados e do ML para se adequarem à sua organização. Os dados podem ser preparados para ML utilizando quaisquer ferramentas de engenharia de dados , como pipelines Lakeflow. As funcionalidades são geridas numa Feature Store tanto para serviço em lote como em tempo real, com uma única fonte de verdade governada para as funcionalidades.
O Genie Code acelera a descoberta e preparação de dados navegando pelo Unity Catalog para descobrir tabelas relevantes, sugerir transformações de funcionalidades e gerar código para ingestão e pipelines de funcionalidades.
| Tipo de funcionalidade | Features |
|---|---|
| Funcionalidades em lote |
|
| Funcionalidades em tempo real |
|
| Dados não estruturados | A Pesquisa por IA permite fornecer dados não estruturados e executar pesquisa semântica. |
Modelos de Train ML
O Azure Databricks tem ferramentas flexíveis para treinar modelos de aprendizagem automática e deep learning. Ambientes pré-configurados e personalizáveis permitem usar bibliotecas de ML personalizadas, e os recursos de computação acelerados por CPU e GPU serverless permitem escalar e expandir à vontade. O Genie Code fornece AutoML inteligente, aceitando pedidos de linguagem natural e construindo fluxos de trabalho completos com múltiplos cadernos para caracterização, treino, ajuste, avaliação e implementação.
| Categoria | Features |
|---|---|
| Tipos de ML | O Azure Databricks suporta todos os tipos de ML, incluindo:
Para IA generativa, veja as capacidades de IA generativa do Azure Databricks. |
| Computação |
|
| Ambientes e bibliotecas |
|
| Assistentes de codificação de IA |
|
Rastrear e gerir experiências
O MLflow gerido pelo Azure Databricks fornece a base para o desenvolvimento de ML reproduzível e auditável. As suas integrações com o Unity Catalog e o Git fornecem rastreamento e linhagem para dados e ativos de código. Cada versão do modelo no registo remete para a execução de treino, o conjunto de dados, o ambiente e o commit Git que lhe deram origem, proporcionando um registo de auditoria completo para qualquer modelo em produção.
| Categoria | Features |
|---|---|
| Acompanhamento de experimentos | O rastreio do MLflow regista parâmetros, métricas e artefactos para cada execução de treino. Compare as execuções na interface do MLflow para identificar a configuração com melhor desempenho. |
| Registo de modelo |
Os modelos no Unity Catalog fornecem um registo de modelos MLflow integrado com o Unity Catalog. Os artefactos de modelos versionados são governados através de pseudónimos de ciclo de vida (Staging, Production), controlo de acesso, linhagem e partilha entre espaços de trabalho. |
| Reprodutibilidade | Notebooks e código podem ser versionados usando pastas Git do Databricks e integrados com qualquer fornecedor Git. |
Implantar e servir modelos
Azure Databricks suporta tanto inferência por lote como serviço em tempo real. A inferência por lote aplica modelos de forma eficiente a grandes conjuntos de dados, enquanto o serviço em tempo real fornece modelos como endpoints de API de baixa latência. O Genie Code pode tanto gerar código para implementação de modelos como diagnosticar problemas e desempenho para endpoints que servem modelos.
| Padrão de serviço | Features |
|---|---|
| Inferência em lote |
|
| Fornecimento em tempo real | Model Serving fornece pontos finais REST geridos de baixa latência e elevada disponibilidade, com dimensionamento automático sem servidor. Isto suporta execução em CPU e GPU para qualquer framework de ML, e pode usar o Genie para avaliar e resolver problemas dos endpoints de serving. |
| Inferência nativa de SQL |
|
Avaliar e monitorizar
O Azure Databricks oferece avaliação flexível para treino e monitorização contínua em produção. O serviço em tempo real dos registos para tabelas de inferências governadas no Unity Catalog, e a monitorização da qualidade dos dados proporciona monitorização com métricas personalizadas, painéis de controlo e alertas.
| Categoria | Features |
|---|---|
| Evaluation |
|
| Registo de previsões | As Tabelas de Inferência registam pedidos e respostas de serviço, permitindo monitorização, análise e construção de conjuntos de treino. |
| Monitorização e alertas |
|
MLOps e governação
O Azure Databricks disponibiliza um conjunto completo de ferramentas para operações de ML (MLOps) e governação. O MLOps Stacks fornece modelos para permitir uma promoção automatizada e repetível do desenvolvimento para a produção, utilizando infrastructure-as-code. Dados, funcionalidades, modelos e endpoints são totalmente governados pelo Unity Catalog e pelo AI Gateway.
| Categoria | Features |
|---|---|
| CI/CD para aprendizagem automática | Os MLOps Stacks, construídos sobre os Declarative Automation Bundles, fornecem gestão e implementação baseada em código da infraestrutura e fluxos de trabalho de ML. Isto inclui modelos CI/CD para automatizar treino, avaliação e implementação. |
| Orquestração do fluxo de trabalho | Lakeflow Jobs orquestra fluxos de trabalho de ML de várias etapas sob a forma de pipelines agendados ou acionados. |
| Governação de ativos de dados e modelos | O Unity Catalog fornece governação unificada para dados, funcionalidades e modelos registados. Controlos de acesso detalhados, rastreio de linhagem e registos de auditoria aplicam-se a todos os ativos. |
| Governação dos endpoints do modelo | O AI Gateway fornece governação centralizada e monitorização para os endpoints dos modelos, incluindo limites de taxa, rastreamento de utilização e registo de payloads. |
Suporte de código aberto
O Azure Databricks oferece suporte total para o ecossistema de ML open-source.
Pode usar qualquer framework de ML open-source no Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray, entre outros. O MLflow ou as suas ferramentas personalizadas podem armazenar artefactos de modelos em formatos abertos que podem ser exportados e executados fora do Azure Databricks.
O MLflow é open-source, criado pela Azure Databricks e utilizado por 10.000+ organizações. Os teus dados de rastreio de experiências, artefactos de modelos e definições de pipeline são armazenados em formatos abertos.
A governação dos dados e da IA baseia-se nas APIs open source do Unity Catalog , e o armazenamento de dados baseia-se no formato aberto Delta Lake . Os seus dados de funcionalidades e conjuntos de dados de treino permanecem em ficheiros abertos e portáteis.