Pools ao vivo personalizados no Microsoft Fabric

Aplica-se a:✅ Engenharia de Dados de Tecido e Ciência de Dados

Pools ao vivo personalizados são clusters Spark pré-aquecidos que proporcionam arranque quase instantâneo de sessões para cargas de trabalho baseadas em notebooks no Fabric. Em vez de esperar pelo provisionamento do cluster em cada execução, pools personalizados ativos mantêm os clusters prontos durante uma janela de agendamento configurada, permitindo tempos de início de sessão de 5 segundos para os seus cadernos interativos e agendados.

Porque usar pools ao vivo personalizados

As sessões padrão do Spark no Fabric requerem provisionamento de clusters sempre que uma sessão começa. Para equipas que usam cadernos frequentes — sejam interativos, agendados ou desencadeados por pipeline — este tempo de provisionamento pode abrandar os ciclos de iteração e aumentar a latência global do trabalho.

Pools personalizadas em tempo real resolvem isto através de:

  • Hidratar clusters antecipadamente com base num calendário definido pelo utilizador, para que a computação esteja pronta quando as cargas de trabalho chegarem.
  • Permitindo um controlo preciso sobre o número de clusters mantidos quentes e o ambiente utilizado para a configuração da biblioteca.
  • Proporciona um desempenho consistente de arranque (~5 segundos) para todos os tipos de sessão de notebook suportados durante a janela agendada.

Piscinas ao vivo personalizadas complementam a piscina inicial existente e as opções personalizadas de piscina Spark em Fabric:

Opção de cálculo Tempo de arranque Baseado em agendamentos Bibliotecas personalizadas Cargas de trabalho suportadas
Piscinas de arranque 5 a 10 segundos (sem a utilização de bibliotecas) No No cadernos, SJD
Piscinas Spark personalizadas ~1 min No Via ambiente cadernos, SJD
Grupos ao vivo personalizados ~5 segundos a 10 segundos (após a hidratação estar completa) Sim Via ambiente Apenas cadernos (interativos e agendados)

Conceitos-chave

Os conceitos seguintes explicam como funcionam os pools ao vivo personalizados, incluindo como os clusters são preparados, quando estão disponíveis e como a capacidade e a configuração da biblioteca são geridas.

Hidratação e aquecimento

Quando crias e publicas um pool ao vivo personalizado, o Fabric começa a hidratar os clusters antes da janela agendada. Hidratação significa que os clusters estão totalmente provisionados, configurados com o ambiente associado e mantidos prontos para uso imediato até chegar um pedido de sessão.

O tempo de arranque de ~5 segundos só está disponível depois de a piscina estar totalmente hidratada. Durante a configuração inicial ou imediatamente após uma alteração de configuração, as sessões podem apresentar tempos de arranque mais longos enquanto a hidratação termina. Para resolução de problemas, consulte Hidratação demora mais do que o previsto.

Horários

Cada pool ao vivo personalizado requer um calendário que defina quando o pool está ativo. Os clusters são mantidos quentes apenas durante a janela agendada, e a faturação ocorre apenas enquanto os clusters são alocados. Quando o horário expira ou um cluster está inativo para além do limite configurado, o Fabric desaloca o cluster e a faturação é interrompida.

Planeie os seus horários para cobrir as janelas esperadas de carga de trabalho, de modo a que a computação quente esteja disponível quando a sua equipa precisar. Para passos de configuração e boas práticas, consulte Configurar um pool ao vivo.

Anexação ao ambiente

Cada pool live personalizado está ligado a um ambiente Fabric. O ambiente controla quais as bibliotecas que estão pré-instaladas em clusters hidratados. Para atualizar bibliotecas, deve modificar e republicar o ambiente. Os clusters hidratados existentes não são atualizados com as novas bibliotecas até à próxima hidratação programada ou uma atualização manual. Para os passos de configuração, veja Configurar um pool ao vivo.

Modos de publicação de bibliotecas

O método de publicação de bibliotecas no ambiente associado determina como as bibliotecas são distribuídas a clusters hidratados.

  • Modo completo: As bibliotecas são resolvidas e integradas definitivamente na imagem do cluster hidratado durante a publicação do ambiente. Quando uma sessão começa, o snapshot em modo completo já está presente no cluster, permitindo o início de uma sessão de aproximadamente 5 segundos. Usa o modo Full quando precisares de uma biblioteca estável e reproduzível com o início de sessão mais rápido possível.
  • Modo rápido: As bibliotecas não estão pré-instaladas em clusters hidratados. Instalam-se, em vez disso, quando a sessão do computador portátil se inicia. Os clusters hidratados continuam a proporcionar uma alocação rápida de computação, mas a instalação da biblioteca no início da sessão adiciona tempo. Use o modo Rápido para iteração rápida durante o desenvolvimento, quando a estabilidade da biblioteca é menos crítica.

Observação

A pasta de Recursos do bloco de notas e as instalações da biblioteca inline (como %pip install numa célula de código) são abordagens manuais por sessão. São independentes do modo de publicação do ambiente e não afetam quais bibliotecas estão pré-instaladas nos clusters hidratados.

Capacidade do cluster

Cada pool tem um número máximo de clusters que defines durante a configuração. O Fabric não escala automaticamente o pool para além deste valor. Quando todos os clusters hidratados estão em uso, as tarefas adicionais recorrem ao provisionamento sob demanda, demorando cerca de 3 a 5 minutos ou mais, dependendo das dependências dos pacotes de bibliotecas. Para orientações sobre tamanhos, veja Dimensionamento em cluster.

Cargas de trabalho suportadas

Pools ao vivo personalizados suportam os seguintes tipos de sessões Spark baseadas em notebooks:

  • Cadernos interativos funcionam a partir do portal Fabric
  • Execuções de cadernos agendados configuradas no agendador de cadernos
  • Execuções de notebooks desencadeadas por pipelines

Observação

As definições de trabalhos do Spark (trabalhos em lote) não são suportadas na versão atual de pools ao vivo personalizados.

Capacidade e licenciamento

Pools ao vivo personalizados requerem um SKU pago com capacidade Fabric. As capacidades do Fabric Trial não são atualmente suportadas.

Para obter informações sobre SKUs de capacidade disponíveis, consulte Conceitos e licenças do Fabric.

Controlo de acesso

As atribuições de funções de espaço de trabalho controlam o acesso à configuração e estado personalizados do pool em tempo real:

Função Permissões
Espectador ou Colaborador Acesso apenas de leitura ao estado e à configuração personalizados de pools em tempo real
Membro Crie, atualize, grave e publique configurações personalizadas de pools dinâmicos para pools Spark personalizados existentes quando um administrador da área de trabalho ative a opção Personalizar a configuração de computação para itens
Administrador Criar e gerir pools personalizados do Spark, ativar a personalização de computação ao nível do item e criar, atualizar, guardar e publicar configurações personalizadas de pools ao vivo

Os pools dinâmicos personalizados utilizam a definição existente do espaço de trabalho Personalizar a configuração de computação para itens. Eles não têm uma configuração de delegação separada. Quando um administrador do espaço de trabalho ativa a definição existente, os Membros podem gerir a computação ao nível do ambiente e as configurações de grupos dinâmicos personalizados. A definição não permite aos Membros criar pools personalizados no Spark ou alterar definições do Spark ao nível do workspace.

Para os passos de configuração, veja Usar a configuração de personalização de computação existente.

Deve atribuir um papel explícito de espaço de trabalho aos utilizadores convidados B2B para que possam interagir com pools ao vivo personalizados. Atribui ao Membro ou ao Administrador o papel se precisarem de criar ou atualizar uma configuração de pool em funcionamento.

Limitações

As seguintes restrições aplicam-se a pools ativos personalizados na versão atual:

  • As sessões começam em ~5 segundos apenas depois de a piscina estar totalmente hidratada. Durante a configuração inicial ou depois de alterar a configuração, os tempos de arranque podem ser mais longos.
  • As alterações na biblioteca exigem a republicação do ambiente anexo. Clusters hidratados não são automaticamente renovados.
  • Quando o ambiente associado usa o modo Quick para algumas bibliotecas, essas bibliotecas não estão pré-instaladas em clusters hidratados e têm de ser instaladas no arranque da sessão. Para o arranque de sessões mais rápido com pools dinâmicos personalizados, utilize o modo Full para as dependências da sua biblioteca.
  • Apenas são suportadas sessões Spark baseadas em notebook. As definições de tarefas Spark não são suportadas.
  • As capacidades de teste de tecido não são suportadas.
  • Cada piscina deve ter um horário. Pools sem calendário não podem ser publicados.
  • Pools personalizados ativos não podem ser geridos através de APIs públicas do ambiente ou pipelines de CI/CD. A configuração deve ser feita através do portal Fabric.