Nota
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Este tutorial te guía para configurar la extensión del IDE de Databricks y luego ejecutar Python en un clúster de Azure Databricks y como un trabajo de Azure Databricks en tu espacio de trabajo remoto. Consulta la extensión del IDE Databricks.
Requisitos
Este tutorial requiere lo siguiente:
- Has instalado la extensión del IDE Databricks. Consulta Instalar la extensión del IDE Databricks.
- Tiene un clúster remoto de Azure Databricks para usar. Anote el nombre del clúster. Para ver los clústeres disponibles, en la barra lateral del área de trabajo de Azure Databricks, haga clic en Compute. Consulte Computación.
Paso 1: Crear un nuevo proyecto de Databricks
En este paso, creará un nuevo proyecto de Databricks y configurará la conexión con el área de trabajo de Azure Databricks remota.
- Inicie Visual Studio Code y haga clic en File > Abrir carpeta y abra una carpeta vacía en el equipo de desarrollo local.
- En la barra lateral, haga clic en el icono del logotipo de Databricks. Se abrirá la extensión de Databricks.
- En la vista de configuración , haga clic en Crear configuración.
- Se abre la paleta de comandos para configurar el área de trabajo de Databricks. En Host de Databricks, escriba o seleccione la dirección URL para cada área de trabajo, por ejemplo,
https://adb-1234567890123456.7.azuredatabricks.net. - Seleccione un perfil de autenticación para el proyecto. Consulta Configurar autorización para la extensión del IDE Databricks.
Paso 2: Agregar información de clúster a la extensión de Databricks e iniciar el clúster
Con la vista Configuración ya abierta, haga clic en Seleccionar un clúster o haga clic en el icono de engranaje (Configurar clúster).
En la paleta de comandos, seleccione el nombre del clúster que creó anteriormente.
Si aún no se ha iniciado, haga clic en el icono de reproducción (Iniciar clúster).
Paso 3: Crear y ejecutar código Python
Cree un archivo de código de Python local: en la barra lateral, haga clic en el icono de carpeta (Explorer).
En el menú principal, haga clic en File > Nuevo archivo y elija un archivo Python. Asigne al archivo el nombre demo.py y guárdelo en la raíz del proyecto.
Agregue el siguiente código al archivo y guárdelo. Este código crea y muestra los contenidos de un DataFrame de PySpark básico:
from pyspark.sql import SparkSession from pyspark.sql.types import * spark = SparkSession.builder.getOrCreate() schema = StructType([ StructField('CustomerID', IntegerType(), False), StructField('FirstName', StringType(), False), StructField('LastName', StringType(), False) ]) data = [ [ 1000, 'Mathijs', 'Oosterhout-Rijntjes' ], [ 1001, 'Joost', 'van Brunswijk' ], [ 1002, 'Stan', 'Bokenkamp' ] ] customers = spark.createDataFrame(data, schema) customers.show()# +----------+---------+-------------------+ # |CustomerID|FirstName| LastName| # +----------+---------+-------------------+ # | 1000| Mathijs|Oosterhout-Rijntjes| # | 1001| Joost| van Brunswijk| # | 1002| Stan| Bokenkamp| # +----------+---------+-------------------+Haga clic en el icono Ejecutar en Databricks junto a la lista de pestañas del editor y, a continuación, haga clic en Cargar y ejecutar archivo. La salida aparece en la vista Consola de depuración.
En la vista Explorer, también puede hacer clic con el botón derecho en el archivo
demo.pyy después en Ejecutar en Databricks>Cargar y ejecutar archivo.
Paso 4: Ejecutar el código como un trabajo
Para ejecutar demo.py como un trabajo, haga clic en el icono Ejecutar en Databricks junto a la lista de pestañas del editor y, a continuación, haga clic en Ejecutar archivo como flujo de trabajo. La salida aparece en una pestaña del editor independiente junto al editor de archivos demo.py.
También puede hacer clic con el botón derecho en el archivo demo.py en el panel Explorador y, a continuación, seleccionar Ejecutar en Databricks>Ejecutar archivo como flujo de trabajo.
Pasos siguientes
Ahora que has utilizado con éxito la extensión del IDE de Databricks para subir un archivo Python local y ejecutarlo remotamente, también puedes:
- Explore los recursos y las variables de la automatización declarativa mediante la interfaz de la extensión. Consulta Bundle y funciones del explorador.
- Ejecute o depure Python código con Databricks Connect. Consulta Depurar código usando Databricks Connect para la extensión del IDE Databricks.
- Ejecute un archivo o un cuaderno como un trabajo de Azure Databricks. Consulta Ejecutar un archivo en un clúster o un archivo o cuaderno como un trabajo en Azure Databricks usando la extensión del IDE Databricks.
- Ejecutar pruebas con
pytest. Consulta Ejecutar pruebas en Python usando la extensión del IDE Databricks.