Nota
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Como destinatario de Azure Databricks, puede importar un archivo de credenciales desde un proveedor abierto y leer los recursos de datos compartidos. Puede consultar los datos compartidos en el Explorador de catálogos o usar un cuaderno de Python.
Nota:
Si los datos se han compartido con usted mediante Databricks-to-Databricks OpenSharing, no necesita un archivo de credenciales para acceder a los datos y esta página no se aplica a usted. En su lugar, consulte Lectura de datos compartidos mediante Databricks-to-Databricks OpenSharing (para destinatarios).
Requirements
Un miembro del equipo debe descargar el archivo de credenciales que comparte el proveedor de datos y usar un canal seguro para compartir ese archivo o ubicación de archivo con usted. Consulte cómo obtener acceso en el modelo Open-to-Databricks.
Nota:
El proveedor determina el bucket de almacenamiento y las capacidades de las credenciales (ámbito, expiración, solo lectura o lectura y escritura). Si el proveedor es un proveedor de Azure Databricks, montar un recurso compartido abierto en un espacio de trabajo de Secure Egress Gateway (SEG) añade automáticamente a la lista de permitidos el bucket del proveedor para el acceso saliente. Para los proveedores abiertos que no son de Databricks, el cubo no se incluye automáticamente en la lista de permitidos. Compruebe el proveedor antes del montaje.
Compruebe que cuando un proveedor abierto comparte tablas mediante la vending de credenciales (acceso basado en directorios), esas tablas están respaldadas por el almacenamiento en la nube que usa uno de los siguientes esquemas admitidos: s3, , s3as3n, abfss, , wasbsgso r2. Las tablas almacenadas mediante un esquema no compatible (por ejemplo, el esquema no cifrado wasb) no se pueden leer mediante el suministro de credenciales.
Importación de un proveedor y consulta de datos compartidos
En esta sección se describe cómo importar un proveedor y cómo consultar los datos compartidos en el Explorador de catálogos o en un cuaderno de Python:
Si el área de trabajo de Azure Databricks está habilitada para el catálogo de Unity, use la interfaz de usuario del proveedor de importación en el Explorador de catálogos. Puede hacer lo siguiente sin necesidad de almacenar o especificar un archivo de credenciales:
- Cree catálogos a partir de recursos compartidos con el clic de un botón.
- Use los controles de acceso del catálogo de Unity para conceder acceso a las tablas compartidas.
- Consulta de datos compartidos mediante la sintaxis estándar del Catálogo de Unity.
- Aplique una credencial girada al objeto de proveedor existente sin volver a crear el catálogo. Consulte Rotación de credenciales para destinatarios abiertos.
Si el área de trabajo de Azure Databricks no está habilitada para el catálogo de Unity, siga las instrucciones del cuaderno de Python en su lugar.
Explorador de catálogos
Permisos necesarios: un administrador del metastore o un usuario con el privilegio CREATE PROVIDER para su metastore de Unity Catalog. Para crear catálogos desde el recurso compartido, se necesita el privilegio CREATE CATALOG.
En el área de trabajo de Azure Databricks, haga clic en
Catalog para abrir el Explorador de catálogos.
En la parte superior del panel Catálogo, haga clic en
y seleccione Abrir uso compartido. Como alternativa, en la esquina superior derecha, haga clic en Compartir > openSharing.
En la pestaña Compartido conmigo , haga clic en Instalar recurso compartido.
Escriba el nombre del proveedor. El nombre no puede incluir espacios.
Cargue el archivo de credenciales que el proveedor ha compartido con usted. Muchos proveedores tienen sus propias redes openSharing de las que puede recibir recursos compartidos. Para obtener más información, consulte Configuraciones específicas del proveedor.
(Opcional) Escriba un comentario.
Haga clic en Importar.
En la pestaña Recursos compartidos, haga clic en Crear catálogo en la fila del recurso compartido para crear catálogos a partir de datos compartidos.
Para obtener información sobre el uso de SQL o la CLI de Databricks para crear un catálogo a partir de un recurso compartido, consulte Creación de un catálogo a partir de un recurso compartido.
Conceda acceso a los catálogos. Consulte ¿Cómo hago que los datos compartidos estén disponibles para mi equipo? y Administrar permisos para los esquemas, las tablas y los volúmenes en un catálogo de OpenSharing.
Lea los objetos de datos compartidos como haría con cualquier objeto de datos registrado en el Catálogo de Unity.
Para obtener más información y ejemplos, consulte Datos de Access en una tabla o volumen compartidos.
Pitón
Lea los datos compartidos mediante un cuaderno en el área de trabajo de Azure Databricks si el área de trabajo no está habilitada para el catálogo de Unity. Almacene el archivo de credenciales en Azure Databricks y úselo para autenticarse en el proveedor de datos y leer los datos compartidos.
Nota:
En estas instrucciones se supone que el área de trabajo de Azure Databricks no está habilitada para el catálogo de Unity. Si usa Unity Catalog, no es necesario que apunte al archivo de credenciales al leer desde el recurso compartido. Puede leer desde tablas compartidas como lo hace desde cualquier tabla registrada en el catálogo de Unity. Databricks recomienda usar la interfaz de usuario del proveedor de importación en el Explorador de catálogos en lugar de las instrucciones que se proporcionan aquí.
En primer lugar, almacene el archivo de credenciales como un archivo de área de trabajo de Azure Databricks para que los usuarios del equipo puedan acceder a los datos compartidos.
- Para importar el archivo de credenciales en el área de trabajo de Azure Databricks, consulte Importación de un archivo.
- Puede conceder a otros usuarios permiso para acceder al archivo haciendo clic en el
Junto al archivo, luego Compartir (permisos). Escriba las identidades de Azure Databricks que deben tener acceso al archivo. Para obtener más información sobre los permisos de archivo, vea ACL de archivo.
Ahora que se almacena el archivo de credenciales, cree un cuaderno para enumerar y leer tablas compartidas.
En el espacio de trabajo de Azure Databricks, haga clic en Nuevo > Notebook. Para más información sobre los cuadernos de Azure Databricks, consulte Cuadernos de Databricks.
Instale el
delta-sharingconector y use Python,pandas, o Apache Spark para enumerar y leer las tablas compartidas. Use la ruta de acceso del área de trabajo al archivo de credenciales (por ejemplo,/Workspace/Users/user.name@email.com/config.share) como ruta de acceso del perfil. Para obtener ejemplos de código, consulte Pandas: Lectura de datos compartidos y Apache Spark: Lectura de datos compartidos.Además de los comandos Python y Apache Spark, puede consultar datos compartidos mediante SQL. Cree una tabla local en el área de trabajo desde la tabla compartida y, a continuación, consulte la tabla local. Los datos compartidos no se guardan ni almacenan en caché en la tabla local. Cada vez que se consulta la tabla local, se ve el estado actual de los datos compartidos.
Reemplace las variables como se muestra a continuación:
-
<local-table-name>: nombre de la tabla local. -
<profile-path>: ubicación del archivo de credenciales. -
<share-name>: valor deshare=para la tabla. -
<schema-name>: valor deschema=para la tabla. -
<table-name>: valor dename=para la tabla.
%sql DROP TABLE IF EXISTS <local-table-name>; CREATE TABLE <local-table-name> USING deltaSharing LOCATION "<profile-path>#<share-name>.<schema-name>.<table-name>"; SELECT * FROM <local-table-name> LIMIT 10;-
Al ejecutar el comando, los datos compartidos se consultan directamente. Como prueba, se consulta la tabla y se devuelven los diez primeros resultados.
Si la salida está vacía o no contiene los datos esperados, póngase en contacto con el proveedor de datos.
Se aplican las limitaciones del conector de Python de OpenSharing. Consulte Limitaciones del conector de openSharing Python.
Limitations
El uso compartido de Open-to-Databricks se basa en el protocolo OpenSharing. La compatibilidad siguiente se aplica al importar un proveedor abierto en Azure Databricks:
- Únicamente las tablas Delta compatibles con el protocolo Delta Sharing. No se admiten las tablas exclusivas de Iceberg.
- Se admite el acceso tanto a la dirección URL presignada como al token en la nube (basado en directorios ). Azure Databricks prefiere el acceso al token en la nube cuando el proveedor lo pone a disposición.
- Solo se admiten los siguientes esquemas de almacenamiento de tokens en la nube:
s3,s3a,s3nabfss,wasbs, ,gsyr2.
Para leer datos que no son de Delta, como Iceberg, CSV, Parquet o JSON, desde un origen externo, utilice la federación de Lakehouse en su lugar. Consulte Conexión a bases de datos externas y catálogos.