Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Artikel ini menyediakan contoh sintaks penggunaan Apache Spark untuk mengkueri data yang dibagikan menggunakan OpenSharing.
deltasharing Gunakan kata kunci sebagai opsi format untuk operasi DataFrame.
Opsi lain untuk menelusuri data yang dibagikan
Anda juga dapat membuat kueri yang menggunakan nama tabel bersama di katalog OpenSharing yang terdaftar di metastore, seperti yang ada dalam contoh berikut:
SQL
SELECT * FROM shared_table_name
Python
spark.read.table("shared_table_name")
Untuk informasi selengkapnya tentang mengonfigurasi OpenSharing di Azure Databricks dan mengkueri data menggunakan nama tabel bersama, lihat Membaca data yang dibagikan menggunakan Databricks-to-Databricks OpenSharing (untuk penerima).
Anda dapat menggunakan Streaming Terstruktur untuk memproses rekaman dalam tabel bersama secara bertahap. Untuk menggunakan Streaming Terstruktur, Anda harus mengaktifkan berbagi riwayat untuk tabel. Lihat ALTER SHARE. Berbagi riwayat memerlukan Databricks Runtime 12.2 LTS atau lebih tinggi.
Jika tabel bersama telah mengubah umpan data yang diaktifkan pada tabel Delta sumber dan riwayat yang diaktifkan pada berbagi, Anda dapat menggunakan umpan data perubahan saat membaca berbagi OpenSharing dengan Streaming Terstruktur atau operasi batch. Lihat Menggunakan umpan data perubahan pada Azure Databricks.
Baca dengan kata kunci format OpenSharing
Kata kunci deltasharing didukung untuk operasi baca DataFrame Apache Spark, seperti yang ditunjukkan dalam contoh berikut:
df = (spark.read
.format("deltasharing")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)
Membaca umpan data perubahan untuk tabel OpenSharing yang dibagikan
Untuk tabel yang memiliki riwayat bersama dan umpan data perubahan diaktifkan, Anda dapat membaca rekaman umpan data perubahan menggunakan Apache Spark DataFrames. Berbagi riwayat memerlukan Databricks Runtime 12.2 LTS atau lebih tinggi.
df = (spark.read
.format("deltasharing")
.option("readChangeFeed", "true")
.option("startingTimestamp", "2021-04-21 05:45:46")
.option("endingTimestamp", "2021-05-21 12:00:00")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)
Baca tabel yang dibagikan OpenSharing menggunakan Structured Streaming
Untuk tabel yang memiliki riwayat yang dibagikan, Anda dapat menggunakan tabel bersama sebagai sumber untuk Streaming Terstruktur. Berbagi riwayat memerlukan Databricks Runtime 12.2 LTS atau lebih tinggi.
streaming_df = (spark.readStream
.format("deltasharing")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)
# If CDF is enabled on the source table
streaming_cdf_df = (spark.readStream
.format("deltasharing")
.option("readChangeFeed", "true")
.option("startingTimestamp", "2021-04-21 05:45:46")
.load("<profile-path>#<share-name>.<schema-name>.<table-name>")
)