Recursos de ciência de dados e ML do Azure Databricks

Azure Databricks tem uma plataforma unificada para o ciclo de vida completo de DS (ciência de dados) e ML (machine learning), desde ingestão de dados brutos até engenharia de recursos, treinamento de modelo, implantação e monitoramento de produção. Azure Databricks integra-se com estruturas ML de software livre populares, adicionando governança de nível empresarial, observabilidade e ferramentas operacionais, coletivamente conhecidas como MLOps.

Esta página lista os principais recursos de DS e ML, organizados por estágio de fluxo de trabalho.

Análise exploratória de dados

Azure Databricks simplifica a análise exploratória de dados (EDA) fornecendo ferramentas interativas, colaborativas e assistidas por IA para cientistas de dados. Os cientistas de dados podem explorar dados usando chat em linguagem natural, interface do usuário ou código e podem colaborar usando a co-edição em tempo real e o compartilhamento de código baseado em Git. O Genie Code pode fazer um EDA totalmente automatizado ou atuar como um assistente interativo.

Category Features
Interface do usuário
  • Os notebooks fornecem espaços colaborativos para exploração, visualização e documentação para o EDA.
  • Os painéis fornecem SQL e EDA baseado em visualização.
  • O Genie Chat tem uma interface de linguagem natural para fazer perguntas sobre dados.
Collaboration
Assistentes de IA

Preparar e servir funcionalidades

Azure Databricks simplifica os dados para ML unificando a governança de dados e cargas de trabalho de ML. Com todos os dados gerenciados no Catálogo do Unity com controles de acesso refinados, você pode ajustar a engenharia de dados e os limites de ML para se ajustar à sua organização. Os dados podem ser preparados para ML com o uso de qualquer ferramenta de engenharia de dados, como os pipelines Lakeflow. Os recursos são gerenciados em um Armazenamento de Recursos para serviços em lote e em tempo real, com uma fonte gerenciada da verdade para recursos.

O Genie Code acelera a descoberta e a preparação de dados navegando no Catálogo do Unity para descobrir tabelas relevantes, sugerindo transformações de recursos e gerando código para a ingestão e pipelines de recursos.

Tipo de funcionalidade Features
Funcionalidades de processamento em lote
  • Tabelas de atributos no Unity Catalog armazenam atributos em lote pré-calculados com linhagem e governança automáticas. As equipes descobrem e reutilizam funcionalidades existentes em vez de reconstruir pipelines do zero.
  • Visões de Recursos fornecem uma nova API para definir recursos, que podem então ser usados para cálculo de recursos em lote ou em tempo real.
Recursos em tempo real
  • Para recursos pré-compilados, os armazenamentos de recursos online atendem a tabelas de recursos para casos de uso de modelo em tempo real.
  • Quando as entradas de definição de recursos só estão disponíveis no momento do serviço, o serviço de recursos tem computação de recursos sob demanda para complementar tabelas de recursos. As características são definidas como funções, em vez de serem pré-computadas.
  • Visões de Recursos fornecem uma nova API para definir recursos, que podem então ser usados para cálculo de recursos em lote ou em tempo real.
Dados não estruturados A Pesquisa de IA permite o fornecimento de dados não estruturados e a execução da pesquisa semântica.

Treinar modelos de Machine Learning

Azure Databricks tem ferramentas flexíveis para treinar modelos de ML e aprendizado profundo. Ambientes pré-configurados e personalizáveis permitem que você use bibliotecas de ML personalizadas, e recursos de computação Sem servidor acelerados por CPU e GPU permitem escalar vertical e horizontalmente sob demanda. Genie Code oferece AutoML inteligente, recebendo solicitações em linguagem natural e criando fluxos de trabalho completos com vários notebooks para engenharia de atributos, treinamento, ajuste, avaliação e implantação.

Category Features
Tipos de ML Azure Databricks dá suporte a todos os tipos de ML, incluindo:
  • ML clássico: aprendizado supervisionado e não supervisionado com scikit-learn, XGBoost, LightGBM, Apache Spark MLlib e outras estruturas de ML
  • Aprendizado profundo: treinamento de redes neurais com PyTorch, TensorFlow e Hugging Face Transformers, incluindo treinamento distribuído em múltiplas GPUs
  • Ajuste de hiperparâmetro: pesquisa automatizada entre espaços de algoritmo e hiperparâmetro usando ferramentas como Optuna e Ray

Para IA, consulte Azure Databricks recursos de IA.
Computação
  • A computação sem servidor começa instantaneamente para notebooks interativos e fluxos de trabalho agendados, com dimensionamento automático e sem gerenciamento de cluster. Ele dá suporte a clusters acelerados por CPU e GPU.
  • A computação clássica tem gerenciamento de cluster e de computador único para cargas de trabalho de CPU e GPU.
Ambientes e bibliotecas
  • Ambientes de computação sem servidor fornecem ambientes base que podem ser totalmente personalizados para ML. Para computação de GPU sem servidor, o AI Runtime fornece ambientes pré-configurados para treinamento e inferência baseados em GPU.
  • Para computação clássica, o Databricks Runtime para Machine Learning fornece ambientes de cluster pré-configurados com bibliotecas ML principais pré-instaladas e testadas em conjunto, para clusters acelerados por CPU e GPU.
Assistentes de codificação de IA

Acompanhar e gerenciar experimentos

MLflow gerenciado pelo Azure Databricks fornece a base para o desenvolvimento de ML reproduzível e auditável. Suas integrações com o Catálogo do Unity e o Git fornecem acompanhamento e linhagem para ativos de dados e código. Cada versão do modelo no registro remete à execução de treinamento, ao conjunto de dados, ao ambiente e ao commit do Git que o originaram, fornecendo uma trilha de auditoria completa para qualquer modelo implantado.

Category Features
Acompanhamento de experimentos Rastreamento do MLflow registra em log parâmetros, métricas e artefatos para cada execução de treinamento. Compare as execuções na interface do usuário do MLflow para identificar a configuração de melhor desempenho.
Registro de modelos Os modelos no Catálogo do Unity fornecem um registro de modelo do MLflow integrado ao Catálogo do Unity. Os artefatos de modelo com controle de versão são regidos por aliases de ciclo de vida (Staging, Production), controle de acesso, linhagem e compartilhamento entre workspaces.
Reprodutibilidade Notebooks e código podem ter controle de versão usando pastas Git do Databricks e integrados a qualquer provedor Git.

Implantar e servir modelos

O Azure Databricks comporta tanto a inferência em lote quanto o serviço em tempo real. A inferência em lote aplica modelos com eficiência a grandes conjuntos de dados, enquanto o serviço em tempo real disponibiliza os modelos como pontos de extremidade de API com baixa latência. O Genie Code pode tanto gerar código para a implantação de modelos quanto diagnosticar problemas e avaliar o desempenho de endpoints de disponibilização de modelos.

Padrão de serviço Features
Inferência em lote
Fornecimento em tempo real Model Serving fornece endpoints REST gerenciados de baixa latência e alta disponibilidade com escalonamento automático sem servidor. Isso comporta o serviço de CPU e GPU para qualquer estrutura de ML, e você pode usar o Genie para avaliar e solucionar problemas em pontos de extremidade de serviço.
Inferência nativa de SQL

Avaliar e monitorar

Azure Databricks fornece avaliação flexível para treinamento e monitoramento contínuo para produção. Os logs de serviço em tempo real são gravados em tabelas de inferência controladas no Unity Catalog e o monitoramento de qualidade de dados fornece monitoramento com métricas, painéis e alertas personalizados.

Category Features
Evaluation
  • avaliação de ML do MLflow pode ser usada para definir métricas a serem registradas em log no MLflow, ou o rastreamento do MLflow pode registrar em log métricas computadas usando sua estrutura personalizada.
  • O Genie Code pode ajudar na seleção de métricas de avaliação e na gravação do código de avaliação.
Registro de previsões Tabelas de inferência registram solicitações e respostas, permitindo monitoramento, análises e a construção de conjuntos de treinamento.
Monitoramento e alertas

MLOps e governança

Azure Databricks fornece um conjunto completo de ferramentas para MLOps (operações de ML) e governança. O MLOps Stacks fornece modelos para habilitar a promoção automatizada e repetível do desenvolvimento à produção usando a infraestrutura como código. Dados, recursos, modelos e endpoints são totalmente governados pelo Unity Catalog e pelo AI Gateway.

Category Features
CI/CD para ML O MLOps Stacks, baseado em Pacotes de Automação Declarativa, fornece gerenciamento baseado em código e implantação de infraestrutura e fluxos de trabalho de ML. Isso inclui modelos de CI/CD para automatizar treinamento, avaliação e implantação.
Orquestração de fluxo de trabalho Lakeflow Jobs orquestra fluxos de trabalho de ML de várias etapas em pipelines agendados ou acionados.
Governança de ativos de dados e de modelos O Catálogo do Unity fornece governança unificada para dados, recursos e modelos registrados. Controles de acesso refinado, acompanhamento de linhagem e logs de auditoria se aplicam a todos os ativos.
Governança de ponto de extremidade de modelo Gateway de IA fornece governança centralizada e monitoramento para pontos de extremidade de modelo, incluindo limites de taxa, rastreamento de uso e registro em log de cargas úteis.

Suporte de software livre

Azure Databricks fornece suporte total para o ecossistema de software livre do ML.

Você pode usar qualquer framework de ML de código aberto no Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray e muito mais. O MLflow ou suas ferramentas personalizadas podem armazenar artefatos de modelo em formatos abertos que podem ser exportados e executados fora Azure Databricks.

O MLflow é de software livre, criado por Azure Databricks e usado por mais de 10.000 organizações. Seus dados de acompanhamento de experimentos, artefatos de modelo e definições de pipeline são armazenados em formatos abertos.

A governança de dados e IA é criada com base nas APIs de catálogo do Unity de software livre e o armazenamento de dados é baseado no formato Delta Lake aberto. Seus dados de recursos e conjuntos de dados de treinamento permanecem em arquivos abertos e portáteis.

Recursos adicionais