Observação
O acesso a essa página exige autorização. Você pode tentar entrar ou alterar diretórios.
O acesso a essa página exige autorização. Você pode tentar alterar os diretórios.
Este tutorial guia você como configurar a extensão do IDE do Databricks e, em seguida, rodar Python em um cluster do Azure Databricks e como um trabalho do Azure Databricks no seu espaço de trabalho remoto. Veja extensão do IDE Databricks.
Requisitos
Este tutorial exige que:
- Você instalou a extensão do IDE do Databricks. Veja Instalar a extensão do IDE Databricks.
- Você tem um cluster de Azure Databricks remoto a ser usado. Anote o nome do cluster. Para exibir seus clusters disponíveis, na barra lateral do workspace Azure Databricks, clique em Compute. Consulte Computar.
Etapa 1: Criar um novo projeto do Databricks
Nesta etapa, você criará um novo projeto do Databricks e configurará a conexão com seu workspace de Azure Databricks remoto.
- Inicie Visual Studio Code, clique em File > Abrir Pasta e abra uma pasta vazia no computador de desenvolvimento local.
- Na barra lateral, clique no ícone do logotipo do Databricks. Isso abrirá a extensão do Databricks.
- No modo de exibição de Configuração, clique em Criar configuração.
- A Paleta de Comandos para configurar o workspace do Databricks é aberta. Para Host do Databricks, insira ou selecione sua URL de cada workspace, por exemplo
https://adb-1234567890123456.7.azuredatabricks.net. - Selecione um perfil de autenticação para o projeto. Veja Configurar autorização para a extensão do IDE Databricks.
Etapa 2: Adicionar informações do cluster à extensão do Databricks e iniciar o cluster
Com a exibição Configuração já aberta, clique em Selecionar um cluster ou no ícone de engrenagem (Configurar cluster).
Na Paleta de Comandos, selecione o nome do cluster que você criou anteriormente.
Clique no ícone de reprodução (Iniciar cluster) se ele ainda não tiver sido iniciado.
Etapa 3: Criar e executar Python código
Crie um arquivo de código de Python local: na barra lateral, clique no ícone pasta (Explorer).
No menu principal, clique em File > Novo Arquivo e escolha um arquivo Python. Nomeie o arquivo demo.py e salve-o na raiz do projeto.
Adicione o código a seguir ao arquivo e salve-o. Esse código cria e exibe o conteúdo de um DataFrame PySpark básico:
from pyspark.sql import SparkSession from pyspark.sql.types import * spark = SparkSession.builder.getOrCreate() schema = StructType([ StructField('CustomerID', IntegerType(), False), StructField('FirstName', StringType(), False), StructField('LastName', StringType(), False) ]) data = [ [ 1000, 'Mathijs', 'Oosterhout-Rijntjes' ], [ 1001, 'Joost', 'van Brunswijk' ], [ 1002, 'Stan', 'Bokenkamp' ] ] customers = spark.createDataFrame(data, schema) customers.show()# +----------+---------+-------------------+ # |CustomerID|FirstName| LastName| # +----------+---------+-------------------+ # | 1000| Mathijs|Oosterhout-Rijntjes| # | 1001| Joost| van Brunswijk| # | 1002| Stan| Bokenkamp| # +----------+---------+-------------------+Clique no ícone Executar no Databricks ao lado da lista de guias do editor e clique em Carregar e Executar Arquivo. A saída aparece na exibição Console de Depuração.
Como alternativa, na exibição do Explorer, clique com o botão direito do mouse no arquivo
demo.pye, em seguida, clique em Executar no Databricks>Carregar e Executar Arquivo.
Etapa 4: Executar o código como um trabalho
Para executar demo.py como um trabalho, clique no ícone Executar no Databricks ao lado da lista de guias do editor e clique em Executar Arquivo como Fluxo de Trabalho. A saída aparece em uma guia de editor separada próxima ao editor de arquivos demo.py.
Como alternativa, clique com o botão direito do mouse no arquivo demo.py no painel Gerenciador e selecione Executar no Databricks>Executar Arquivo como Fluxo de Trabalho.
Próximas etapas
Agora que você usou com sucesso a extensão do IDE Databricks para enviar um arquivo Python local e executá-lo remotamente, você também pode:
- Explore os recursos e variáveis dos Pacotes de Automação Declarativa usando a interface do usuário da extensão. Veja os recursos Bundle e explorador.
- Execute ou depure Python código com o Databricks Connect. Veja Debug code usando Databricks Connect para a extensão do IDE Databricks.
- Execute um arquivo ou um bloco de anotações como um trabalho de Azure Databricks. Veja Executar um arquivo em um cluster, arquivo ou notebook como um trabalho no Azure Databricks usando a extensão do IDE Databricks.
- Execute testes com o
pytest. Veja Executar testes em Python usando a extensão do IDE Databricks.