Nota
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
En este artículo se proporcionan ejemplos de sintaxis del uso de Apache Spark para consultar datos compartidos mediante OpenSharing. Use la palabra clave deltasharing como opción de formato para las operaciones DataFrame.
Otras opciones para consultar datos compartidos
También puede crear consultas que usen nombres de tabla compartidos en catálogos openSharing registrados en el metastore, como los de los ejemplos siguientes:
SQL
SELECT * FROM shared_table_name
Python
spark.read.table("shared_table_name")
Para más información sobre cómo configurar OpenSharing en Azure Databricks y consultar datos mediante nombres de tabla compartidos, consulte Lectura de datos compartidos mediante Databricks-to-Databricks OpenSharing (para destinatarios).
Puede utilizar Structured Streaming para procesar registros en tablas compartidas de forma incremental. Para usar Structured Streaming, debe habilitar el uso compartido de historial para la tabla. Consulte ALTER SHARE. El uso compartido del historial requiere Databricks Runtime 12.2 LTS o superior.
Si la tabla compartida tiene habilitado el canal de cambios de datos en la tabla Delta de origen y el historial está habilitado en el recurso compartido, puede usar el canal de cambios de datos al leer un recurso compartido de OpenSharing con Structured Streaming o con operaciones por lotes. Consulte Uso de la fuente de cambios de datos en Azure Databricks.
Lea con la palabra clave de formato OpenSharing.
La palabra clave deltasharing es compatible con las operaciones de lectura de DataFrame de Apache Spark, como se muestra en el ejemplo siguiente:
df = (spark.read
.format("deltasharing")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)
Leer el feed de datos de cambios de las tablas compartidas de OpenSharing
En el caso de las tablas que tienen habilitado el historial compartido y la fuente de distribución de datos modificados, puede leer los registros de fuente de distribución de datos modificados mediante DataFrames de Apache Spark. El uso compartido del historial requiere Databricks Runtime 12.2 LTS o superior.
df = (spark.read
.format("deltasharing")
.option("readChangeFeed", "true")
.option("startingTimestamp", "2021-04-21 05:45:46")
.option("endingTimestamp", "2021-05-21 12:00:00")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)
Lectura de tablas compartidas de OpenSharing mediante Structured Streaming
En el caso de las tablas que tienen historial compartido, puede usar la tabla compartida como origen para Structured Streaming. El uso compartido del historial requiere Databricks Runtime 12.2 LTS o superior.
streaming_df = (spark.readStream
.format("deltasharing")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)
# If CDF is enabled on the source table
streaming_cdf_df = (spark.readStream
.format("deltasharing")
.option("readChangeFeed", "true")
.option("startingTimestamp", "2021-04-21 05:45:46")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)