Capacidades de ciência de dados e ML do Azure Databricks

O Azure Databricks tem uma plataforma unificada para todo o ciclo de vida da ciência de dados (DS) e do machine learning (ML), desde a ingestão de dados brutos até à engenharia de funcionalidades, treino de modelos, implementação e monitorização de produção. O Azure Databricks integra-se com frameworks populares de ML open-source, adicionando governação de nível empresarial, observabilidade e ferramentas operacionais, coletivamente conhecidas como MLOps.

Esta página lista as principais capacidades de DS e ML, organizadas por fase do fluxo de trabalho.

Análise exploratória de dados

O Azure Databricks simplifica a análise exploratória de dados (EDA) ao fornecer ferramentas interativas, colaborativas e assistidas por IA para cientistas de dados. Cientistas de dados podem explorar dados usando chat em linguagem natural, interfaces ou código, e podem colaborar tanto através de co-edição em tempo real como de partilha de código baseada em Git. O Genie Code pode fazer EDA totalmente automatizado ou atuar como assistente interativo.

Categoria Features
Interface de utilizador
  • Os cadernos proporcionam espaços colaborativos para exploração, visualização e documentação para a EDA.
  • Os dashboards fornecem EDA baseada em SQL e visualização.
  • O Genie Chat tem uma interface em linguagem natural para colocar questões sobre dados.
Collaboration
Assistentes de IA

Características de preparação e serviço

O Azure Databricks simplifica os dados para ML ao unificar a governação dos dados e das cargas de trabalho de ML. Com todos os dados geridos no Unity Catalog com controlos de acesso detalhados, pode ajustar os limites da engenharia de dados e do ML para se adequarem à sua organização. Os dados podem ser preparados para ML utilizando quaisquer ferramentas de engenharia de dados , como pipelines Lakeflow. As funcionalidades são geridas numa Feature Store tanto para serviço em lote como em tempo real, com uma única fonte de verdade governada para as funcionalidades.

O Genie Code acelera a descoberta e preparação de dados navegando pelo Unity Catalog para descobrir tabelas relevantes, sugerir transformações de funcionalidades e gerar código para ingestão e pipelines de funcionalidades.

Tipo de funcionalidade Features
Funcionalidades em lote
  • As tabelas de funcionalidades no Catálogo Unity armazenam funcionalidades em lote pré-computadas com linhagem e governação automáticas. As equipas descobrem e reutilizam funcionalidades existentes em vez de reconstruir pipelines do zero.
  • As Feature Views fornecem uma nova API para definir características, que podem depois ser usadas para cálculo em lote ou em tempo real.
Funcionalidades em tempo real
  • Para atributos pré-computados, os repositórios online de atributos disponibilizam tabelas de atributos para casos de utilização de disponibilização de modelos em tempo real.
  • Quando as entradas para a featurização só estão disponíveis no momento da disponibilização, a disponibilização de características permite o cálculo de características a pedido para complementar as tabelas de características. As funcionalidades são definidas como funções, em vez de pré-computadas.
  • As Feature Views fornecem uma nova API para definir características, que podem depois ser usadas para cálculo em lote ou em tempo real.
Dados não estruturados A Pesquisa por IA permite fornecer dados não estruturados e executar pesquisa semântica.

Modelos de Train ML

O Azure Databricks tem ferramentas flexíveis para treinar modelos de aprendizagem automática e deep learning. Ambientes pré-configurados e personalizáveis permitem usar bibliotecas de ML personalizadas, e os recursos de computação acelerados por CPU e GPU serverless permitem escalar e expandir à vontade. O Genie Code fornece AutoML inteligente, aceitando pedidos de linguagem natural e construindo fluxos de trabalho completos com múltiplos cadernos para caracterização, treino, ajuste, avaliação e implementação.

Categoria Features
Tipos de ML O Azure Databricks suporta todos os tipos de ML, incluindo:
  • Classic ML: Aprendizagem supervisionada e não supervisionada com scikit-learn, XGBoost, LightGBM, Apache Spark MLlib e outros frameworks de ML
  • Aprendizagem profunda: Treino em redes neurais com PyTorch, TensorFlow e Hugging Face Transformers, incluindo treino distribuído entre múltiplas GPUs
  • Ajuste de hiperparâmetros: Pesquisa automatizada entre algoritmos e espaços de hiperparâmetros usando ferramentas como Optuna e Ray

Para IA generativa, veja as capacidades de IA generativa do Azure Databricks.
Computação
  • A computação serverless inicia instantaneamente para notebooks interativos e fluxos de trabalho agendados, com escalabilidade automática e sem gestão de clusters. Suporta clusters acelerados por CPU e GPU.
  • A computação clássica tem gestão de máquina única e cluster, tanto para cargas de trabalho de CPU como de GPU.
Ambientes e bibliotecas
  • Ambientes de computação serverless fornecem ambientes base que podem ser totalmente personalizados para ML. Para computação de GPU serverless, o AI Runtime fornece ambientes pré-configurados para treino e inferência baseados em GPU.
  • Para computação clássica, o Databricks Runtime for Machine Learning fornece ambientes de cluster pré-configurados com grandes bibliotecas de ML pré-instaladas e testadas em conjunto, tanto para clusters acelerados por CPU como para GPU.
Assistentes de codificação de IA

Rastrear e gerir experiências

O MLflow gerido pelo Azure Databricks fornece a base para o desenvolvimento de ML reproduzível e auditável. As suas integrações com o Unity Catalog e o Git fornecem rastreamento e linhagem para dados e ativos de código. Cada versão do modelo no registo remete para a execução de treino, o conjunto de dados, o ambiente e o commit Git que lhe deram origem, proporcionando um registo de auditoria completo para qualquer modelo em produção.

Categoria Features
Acompanhamento de experimentos O rastreio do MLflow regista parâmetros, métricas e artefactos para cada execução de treino. Compare as execuções na interface do MLflow para identificar a configuração com melhor desempenho.
Registo de modelo Os modelos no Unity Catalog fornecem um registo de modelos MLflow integrado com o Unity Catalog. Os artefactos de modelos versionados são governados através de pseudónimos de ciclo de vida (Staging, Production), controlo de acesso, linhagem e partilha entre espaços de trabalho.
Reprodutibilidade Notebooks e código podem ser versionados usando pastas Git do Databricks e integrados com qualquer fornecedor Git.

Implantar e servir modelos

Azure Databricks suporta tanto inferência por lote como serviço em tempo real. A inferência por lote aplica modelos de forma eficiente a grandes conjuntos de dados, enquanto o serviço em tempo real fornece modelos como endpoints de API de baixa latência. O Genie Code pode tanto gerar código para implementação de modelos como diagnosticar problemas e desempenho para endpoints que servem modelos.

Padrão de serviço Features
Inferência em lote
Fornecimento em tempo real Model Serving fornece pontos finais REST geridos de baixa latência e elevada disponibilidade, com dimensionamento automático sem servidor. Isto suporta execução em CPU e GPU para qualquer framework de ML, e pode usar o Genie para avaliar e resolver problemas dos endpoints de serving.
Inferência nativa de SQL
  • As funções de IA fornecem previsões de ML acessíveis em SQL para previsão, deteção de anomalias e análise de drivers, sem necessidade de implementação em Python ou modelos.
  • Para modelos personalizados, a função de IA ai_query fornece inferência em lote eficiente, suportada por pontos finais do Model Serving.

Avaliar e monitorizar

O Azure Databricks oferece avaliação flexível para treino e monitorização contínua em produção. O serviço em tempo real dos registos para tabelas de inferências governadas no Unity Catalog, e a monitorização da qualidade dos dados proporciona monitorização com métricas personalizadas, painéis de controlo e alertas.

Categoria Features
Evaluation
Registo de previsões As Tabelas de Inferência registam pedidos e respostas de serviço, permitindo monitorização, análise e construção de conjuntos de treino.
Monitorização e alertas

MLOps e governação

O Azure Databricks disponibiliza um conjunto completo de ferramentas para operações de ML (MLOps) e governação. O MLOps Stacks fornece modelos para permitir uma promoção automatizada e repetível do desenvolvimento para a produção, utilizando infrastructure-as-code. Dados, funcionalidades, modelos e endpoints são totalmente governados pelo Unity Catalog e pelo AI Gateway.

Categoria Features
CI/CD para aprendizagem automática Os MLOps Stacks, construídos sobre os Declarative Automation Bundles, fornecem gestão e implementação baseada em código da infraestrutura e fluxos de trabalho de ML. Isto inclui modelos CI/CD para automatizar treino, avaliação e implementação.
Orquestração do fluxo de trabalho Lakeflow Jobs orquestra fluxos de trabalho de ML de várias etapas sob a forma de pipelines agendados ou acionados.
Governação de ativos de dados e modelos O Unity Catalog fornece governação unificada para dados, funcionalidades e modelos registados. Controlos de acesso detalhados, rastreio de linhagem e registos de auditoria aplicam-se a todos os ativos.
Governação dos endpoints do modelo O AI Gateway fornece governação centralizada e monitorização para os endpoints dos modelos, incluindo limites de taxa, rastreamento de utilização e registo de payloads.

Suporte de código aberto

O Azure Databricks oferece suporte total para o ecossistema de ML open-source.

Pode usar qualquer framework de ML open-source no Azure Databricks: scikit-learn, XGBoost, LightGBM, PyTorch, TensorFlow, Hugging Face Transformers, Ray, entre outros. O MLflow ou as suas ferramentas personalizadas podem armazenar artefactos de modelos em formatos abertos que podem ser exportados e executados fora do Azure Databricks.

O MLflow é open-source, criado pela Azure Databricks e utilizado por 10.000+ organizações. Os teus dados de rastreio de experiências, artefactos de modelos e definições de pipeline são armazenados em formatos abertos.

A governação dos dados e da IA baseia-se nas APIs open source do Unity Catalog , e o armazenamento de dados baseia-se no formato aberto Delta Lake . Os seus dados de funcionalidades e conjuntos de dados de treino permanecem em ficheiros abertos e portáteis.

Recursos adicionais