Gerenciar dependências usando ambientes

Important

Esse recurso está em Beta. Administradores de conta podem controlar o acesso a esse recurso a partir da página de Pré-visualizações do console de conta usando a opção Ambientes para Computação Padrão . Consulte Gerenciar visualizações do Azure Databricks.

Em um recurso de computação clássico que utiliza o modo de dependência de Ambientes , você gerencia as dependências no nível da carga de trabalho usando ambientes base em vez de instalar bibliotecas com escopo de computo.

As configurações de ambiente permanecem isoladas das alterações feitas no nível da computação, de maneira que as cargas de trabalho não sejam afetadas quando a computação subjacente mudar. E como o Azure Databricks mantém os ambientes base em cache, as dependências não precisam ser resolvidas nem instaladas na inicialização, o que faz com que a computação seja iniciada mais rapidamente e evita falhas decorrentes da resolução de pacotes, da disponibilidade de repositórios ou da confiabilidade da rede.

Em um notebook anexado a um recurso clássico de computação que usa o modo de dependência Environments, selecione um ambiente base e adicione dependências no painel lateral Environment do notebook. Para tarefas de trabalho, configure dependências com uma especificação de ambiente de trabalho.

Requirements

A configuração do modo de dependência está disponível apenas em computação que atenda aos seguintes requisitos:

  • Databricks Runtime 19 (Beta) ou superior
  • Modo de acesso padrão
  • Computação de uso geral ou computação para tarefas clássicas

Para detalhes de suporte, veja Limitações.

Defina o modo de dependência

Para criar um recurso de computação clássico que utilize o modo de dependência de Ambientes :

  1. Na barra lateral do espaço de trabalho, clique no ícone de computaçãoComputação e depois abra a aba Computação de uso geral.

  2. Clique em Criar computação.

  3. Em Desempenho, selecione 19 Beta ou superior no menu suspenso da versão do Databricks Runtime.

  4. Expanda a seção Avançada e clique em Dependências.

  5. Para o modo Dependência, mantenha o Auto ativado para que o Azure Databricks resolva o modo, ou clique em Manual e selecione Ambientes para configurá-lo você mesmo. Veja Opções do modo de dependência.

    A guia Dependências na seção Avançada do formulário de criação de computação, com o modo Dependência definido como Automático e resolvendo para Ambientes.

  6. Configure o restante do cálculo e clique em Criar.

Após a execução do cálculo, conecte um caderno e configure seu ambiente conforme descrito em Usar ambientes em um caderno.

Opções de modo de dependência

O controle do modo Dependência possui duas configurações que determinam como o modo é escolhido:

  • Auto: Azure Databricks resolve o modo com base na configuração de computação. Auto é resolvido para Ambientes , a menos que a computação especifique Docker, variáveis de ambiente Spark ou scripts init, quando resolve para Bibliotecas de clusters.
  • Manual: Você seleciona Ambientes ou bibliotecas do cluster sozinho.

Ao selecionar Manual, escolha o modo que melhor se encaixa nas suas necessidades:

  • Ambientes: Gerencie dependências no nível da carga de trabalho usando ambientes base. Bibliotecas de cluster, Docker, variáveis de ambiente Spark e scripts de entrada estão desativados. Use esse modo para isolar dependências para cada carga de trabalho.
  • Bibliotecas de cluster: O comportamento clássico. Instale dependências no compute usando bibliotecas de cluster, scripts de entrada ou Docker. Use esse modo se sua carga de trabalho exigir alguma dessas configurações.

Atualize um cálculo existente

Se você estiver editando as configurações para computação existente, a mudança para o modo Ambientes é bloqueada se a computação tiver configurações incompatíveis, como scripts de init, bibliotecas de cluster ou Docker. Se você remover as configurações incompatíveis primeiro, pode então editar o modo de dependência.

Se você mudar para o modo Cluster de bibliotecas a partir do modo Ambientes , os notebooks conectados mantêm suas seleções de ambiente, mas essas escolhas ficam inativas. Se você recolocar a computação em modo Ambientes, essas seleções voltarão a ser ativas.

Usar ambientes em um notebook

Para usar Ambientes em um notebook, anexe o notebook a um recurso de computação clássico que usa o modo de dependência Ambientes. Depois de anexar o notebook, configure as dependências do notebook no painel lateral ambienteEnvironment.

Configurar o ambiente de um notebook a partir do painel lateral de Ambiente em um recurso de computação clássico que utiliza o modo de dependência de Ambientes.

Selecione um ambiente base

Um ambiente base determina as bibliotecas pré-instaladas e a versão do ambiente disponível para o seu notebook. O seletor de ambiente base no painel lateral ambiente é onde você escolhe seu ambiente. O Databricks recomenda usar a versão mais recente para obter os recursos de notebook mais atualizados. Para ver detalhes sobre cada versão do ambiente, veja Versões do Ambiente.

O seletor de ambiente base inclui as seguintes opções:

  • Padrão: o ambiente base padrão com bibliotecas fornecidas pelo Databricks.
  • ML: um ambiente base com o Python e os pacotes do sistema do Databricks Runtime para Machine Learning pré-instalados.
  • Mais: expande para mostrar opções adicionais:
    • Versões anteriores dos ambientes Standard e ML.
    • Personalizado: especifique um ambiente personalizado usando um arquivo YAML.
  • Ambientes de Workspace: Lista todos os ambientes base compatíveis configurados para o seu workspace pelos administradores do workspace.

Adicionar dependências ao notebook

O Azure Databricks mantém em cache o ambiente virtual do seu notebook, fazendo com que as dependências não sejam reinstaladas sempre que você reabrir um notebook ou retomar o uso após um período de inatividade.

Para instalar individualmente uma dependência:

  1. Na seção Dependências , insira o caminho da dependência no campo e clique em +Adicionar dependência. Você pode especificar uma dependência em qualquer formato que seja válido em um arquivo requirements.txt. Arquivos de roda do Python ou projetos do Python (por exemplo, o diretório que contém um pyproject.toml ou um setup.py) podem estar localizados em arquivos de workspace ou volumes do Catálogo do Unity.

    • Se estiver usando um arquivo de workspace, o caminho deverá ser absoluto e começar com /Workspace/.
    • Se estiver usando um arquivo em um volume do Catálogo do Unity, o caminho deverá estar no seguinte formato: /Volumes/<catalog>/<schema>/<volume>/<path>.whl.
  2. Clique em Apply para instalar as dependências e reiniciar o processo de Python.

Important

Não instale o PySpark nem qualquer biblioteca que o utilize como dependência dos seus notebooks. Isso interromperá sua sessão e resultará em um erro. Se isso acontecer, remova a biblioteca e reinicie seu ambiente.

Para ver as dependências instaladas, clique na guia Installed no painel lateral Environment. Para abrir os logs de instalação do pip para o ambiente de notebook, clique em logs do pip na parte inferior do painel.

Usar ambientes em um trabalho

Para tarefas de trabalho que são executadas em um recurso de computação clássico que usa o modo de dependência Environments, configure as dependências com uma especificação do ambiente do trabalho. Um ambiente de trabalho especifica um ambiente base e quaisquer dependências adicionais que uma ou mais tarefas possam referenciar.

Para configurar um ambiente para uma tarefa de trabalho, conclua as seguintes etapas:

  1. Crie ou edite uma tarefa em um trabalho.
  2. Em Computação, selecione um recurso de computação clássico existente que use o modo de dependência Ambientes ou adicione computação de trabalhos clássicos.
  3. Se você adicionar computação de trabalhos clássicos, expanda Avançado.
  4. Clique em Dependências.
  5. Para o modo de dependência, selecione Manual e Ambientes ou mantenha Auto se ele corresponder a Ambientes.
  6. Em Ambiente e Bibliotecas , na configuração da tarefa, configure um ambiente para a tarefa. Veja Configurar ambiente para tarefas de trabalho para as opções disponíveis para cada tipo de tarefa.

Tarefas executadas em um recurso de computação clássico que usa o modo de dependência Environments não oferecem suporte à configuração de tarefa Dependent libraries. Adicione dependências ao ambiente em vez disso.

Limitations

O modo de dependência Ambientes oferece suporte a cargas de trabalho e dependências do Python em notebooks interativos e tarefas de trabalho. As seguintes limitações se aplicam:

  • As tarefas de JAR do Spark não são compatíveis com um recurso de computação clássico que usa o modo de dependência Environments.
  • Executar %scala código falha.
  • Todas as limitações padrão do modo de acesso se aplicam, incluindo a ausência de suporte para R. Veja Requisitos e limitações de computação padrão.

Configurações incompatíveis

Quando o modo de dependência de Ambientes está ativado, as seguintes configurações de computação são desativadas:

  • Docker (Azure Databricks Container Services)
  • Variáveis do ambiente Spark
  • Scripts de inicialização
  • Bibliotecas de cluster