Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Azure Databricks tem uma plataforma unificada para o ciclo de vida completo de DS (ciência de dados) e ML (machine learning), desde ingestão de dados brutos até engenharia de recursos, treinamento de modelo, implantação e monitoramento de produção. Azure Databricks integra-se com estruturas ML de software livre populares, adicionando governança de nível empresarial, observabilidade e ferramentas operacionais, coletivamente conhecidas como MLOps.
Esta página lista os principais recursos de DS e ML, organizados por estágio de fluxo de trabalho.
Análise exploratória de dados
Azure Databricks simplifica a análise exploratória de dados (EDA) fornecendo ferramentas interativas, colaborativas e assistidas por IA para cientistas de dados. Os cientistas de dados podem explorar dados usando chat em linguagem natural, interface do usuário ou código e podem colaborar usando a co-edição em tempo real e o compartilhamento de código baseado em Git. O Genie Code pode fazer um EDA totalmente automatizado ou atuar como um assistente interativo.
| Category | Features |
|---|---|
| Interface do usuário |
|
| Collaboration |
|
| Assistentes de IA |
|
Preparar e servir funcionalidades
Azure Databricks simplifica os dados para ML unificando a governança de dados e cargas de trabalho de ML. Com todos os dados gerenciados no Catálogo do Unity com controles de acesso refinados, você pode ajustar a engenharia de dados e os limites de ML para se ajustar à sua organização. Os dados podem ser preparados para ML com o uso de qualquer ferramenta de engenharia de dados, como os pipelines Lakeflow. Os recursos são gerenciados em um Armazenamento de Recursos para serviços em lote e em tempo real, com uma fonte gerenciada da verdade para recursos.
O Genie Code acelera a descoberta e a preparação de dados navegando no Catálogo do Unity para descobrir tabelas relevantes, sugerindo transformações de recursos e gerando código para a ingestão e pipelines de recursos.
| Tipo de funcionalidade | Features |
|---|---|
| Funcionalidades de processamento em lote |
|
| Recursos em tempo real |
|
| Dados não estruturados | A Pesquisa de IA permite o fornecimento de dados não estruturados e a execução da pesquisa semântica. |
Treinar modelos de Machine Learning
Azure Databricks tem ferramentas flexíveis para treinar modelos de ML e aprendizado profundo. Ambientes pré-configurados e personalizáveis permitem que você use bibliotecas de ML personalizadas, e recursos de computação Sem servidor acelerados por CPU e GPU permitem escalar vertical e horizontalmente sob demanda. Genie Code oferece AutoML inteligente, recebendo solicitações em linguagem natural e criando fluxos de trabalho completos com vários notebooks para engenharia de atributos, treinamento, ajuste, avaliação e implantação.
| Category | Features |
|---|---|
| Tipos de ML | Azure Databricks dá suporte a todos os tipos de ML, incluindo:
Para IA, consulte Azure Databricks recursos de IA. |
| Computação |
|
| Ambientes e bibliotecas |
|
| Assistentes de codificação de IA |
|
Acompanhar e gerenciar experimentos
MLflow gerenciado pelo Azure Databricks fornece a base para o desenvolvimento de ML reproduzível e auditável. Suas integrações com o Catálogo do Unity e o Git fornecem acompanhamento e linhagem para ativos de dados e código. Cada versão do modelo no registro remete à execução de treinamento, ao conjunto de dados, ao ambiente e ao commit do Git que o originaram, fornecendo uma trilha de auditoria completa para qualquer modelo implantado.
| Category | Features |
|---|---|
| Acompanhamento de experimentos | Rastreamento do MLflow registra em log parâmetros, métricas e artefatos para cada execução de treinamento. Compare as execuções na interface do usuário do MLflow para identificar a configuração de melhor desempenho. |
| Registro de modelos |
Os modelos no Catálogo do Unity fornecem um registro de modelo do MLflow integrado ao Catálogo do Unity. Os artefatos de modelo com controle de versão são regidos por aliases de ciclo de vida (Staging, Production), controle de acesso, linhagem e compartilhamento entre workspaces. |
| Reprodutibilidade | Notebooks e código podem ter controle de versão usando pastas Git do Databricks e integrados a qualquer provedor Git. |
Implantar e servir modelos
O Azure Databricks comporta tanto a inferência em lote quanto o serviço em tempo real. A inferência em lote aplica modelos com eficiência a grandes conjuntos de dados, enquanto o serviço em tempo real disponibiliza os modelos como pontos de extremidade de API com baixa latência. O Genie Code pode tanto gerar código para a implantação de modelos quanto diagnosticar problemas e avaliar o desempenho de endpoints de disponibilização de modelos.
| Padrão de serviço | Features |
|---|---|
| Inferência em lote |
|
| Fornecimento em tempo real | Model Serving fornece endpoints REST gerenciados de baixa latência e alta disponibilidade com escalonamento automático sem servidor. Isso comporta o serviço de CPU e GPU para qualquer estrutura de ML, e você pode usar o Genie para avaliar e solucionar problemas em pontos de extremidade de serviço. |
| Inferência nativa de SQL |
|
Avaliar e monitorar
Azure Databricks fornece avaliação flexível para treinamento e monitoramento contínuo para produção. Os logs de serviço em tempo real são gravados em tabelas de inferência controladas no Unity Catalog e o monitoramento de qualidade de dados fornece monitoramento com métricas, painéis e alertas personalizados.
| Category | Features |
|---|---|
| Evaluation |
|
| Registro de previsões | Tabelas de inferência registram solicitações e respostas, permitindo monitoramento, análises e a construção de conjuntos de treinamento. |
| Monitoramento e alertas |
|
MLOps e governança
Azure Databricks fornece um conjunto completo de ferramentas para MLOps (operações de ML) e governança. O MLOps Stacks fornece modelos para habilitar a promoção automatizada e repetível do desenvolvimento à produção usando a infraestrutura como código. Dados, recursos, modelos e endpoints são totalmente governados pelo Unity Catalog e pelo AI Gateway.
| Category | Features |
|---|---|
| CI/CD para ML | O MLOps Stacks, baseado em Pacotes de Automação Declarativa, fornece gerenciamento baseado em código e implantação de infraestrutura e fluxos de trabalho de ML. Isso inclui modelos de CI/CD para automatizar treinamento, avaliação e implantação. |
| Orquestração de fluxo de trabalho | Lakeflow Jobs orquestra fluxos de trabalho de ML de várias etapas em pipelines agendados ou acionados. |
| Governança de ativos de dados e de modelos | O Catálogo do Unity fornece governança unificada para dados, recursos e modelos registrados. Controles de acesso refinado, acompanhamento de linhagem e logs de auditoria se aplicam a todos os ativos. |
| Governança de ponto de extremidade de modelo | Gateway de IA fornece governança centralizada e monitoramento para pontos de extremidade de modelo, incluindo limites de taxa, rastreamento de uso e registro em log de cargas úteis. |
Suporte de software livre
Azure Databricks fornece suporte total para o ecossistema de software livre do ML.
Você pode usar qualquer framework de ML de código aberto no Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray e muito mais. O MLflow ou suas ferramentas personalizadas podem armazenar artefatos de modelo em formatos abertos que podem ser exportados e executados fora Azure Databricks.
O MLflow é de software livre, criado por Azure Databricks e usado por mais de 10.000 organizações. Seus dados de acompanhamento de experimentos, artefatos de modelo e definições de pipeline são armazenados em formatos abertos.
A governança de dados e IA é criada com base nas APIs de catálogo do Unity de software livre e o armazenamento de dados é baseado no formato Delta Lake aberto. Seus dados de recursos e conjuntos de dados de treinamento permanecem em arquivos abertos e portáteis.