Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Cet article fournit des exemples de syntaxe d’utilisation d’Apache Spark pour interroger des données partagées à l’aide d’OpenSharing. Utilisez le mot clé deltasharing comme option de format pour les opérations DataFrame.
Autres options d’interrogation de fichiers partagés
Vous pouvez également créer des requêtes qui utilisent des noms de tables partagées dans des catalogues OpenSharing inscrits dans le metastore, comme ceux des exemples suivants :
SQL
SELECT * FROM shared_table_name
Python
spark.read.table("shared_table_name")
Pour plus d’informations sur la configuration d’OpenSharing dans Azure Databricks et l’interrogation de données à l’aide de noms de tables partagées, consultez Lire les données partagées à l’aide de Databricks-to-Databricks OpenSharing (pour les destinataires).
Vous pouvez utiliser le flux structuré pour traiter des enregistrements dans des tableaux partagés de manière incrémentielle. Pour utiliser le flux structuré, vous devez activer le partage d’historique pour le tableau. Voir ALTER SHARE. Le partage d’historique requiert Databricks Runtime 12.2 LTS ou une version ultérieure.
Si le flux des données modifiées de la table partagée est activé sur la table Delta source et si l’historique est activé sur le partage, vous pouvez utiliser le flux des données modifiées lors de la lecture d’un partage OpenSharing avec Structured Streaming ou des opérations par lot. Consultez Utiliser le flux de données modifiées sur Azure Databricks.
Lire avec le mot clé de format OpenSharing
Le mot clé deltasharing est pris en charge pour les opérations de lecture de DataFrame Apache Spark, comme illustré dans l’exemple suivant :
df = (spark.read
.format("deltasharing")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)
Lire le flux de données modifiées pour les tables partagées OpenSharing
Pour les tableaux qui ont l’historique partagé et le flux de données modifiées activés, vous pouvez lire les enregistrements de flux de données modifiées à l’aide d’Apache Spark DataFrames. Le partage d’historique requiert Databricks Runtime 12.2 LTS ou une version ultérieure.
df = (spark.read
.format("deltasharing")
.option("readChangeFeed", "true")
.option("startingTimestamp", "2021-04-21 05:45:46")
.option("endingTimestamp", "2021-05-21 12:00:00")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)
Lire des tables partagées OpenSharing à l’aide de Structured Streaming
Pour les tables qui ont l’historique partagé, vous pouvez utiliser le tableau partagé comme source pour le flux structuré. Le partage d’historique requiert Databricks Runtime 12.2 LTS ou une version ultérieure.
streaming_df = (spark.readStream
.format("deltasharing")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)
# If CDF is enabled on the source table
streaming_cdf_df = (spark.readStream
.format("deltasharing")
.option("readChangeFeed", "true")
.option("startingTimestamp", "2021-04-21 05:45:46")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)