Mereplikasi Snowflake di Microsoft Fabric

Mirroring di Fabric memberikan pengalaman mudah untuk menghindari ETL (Ekstrak Transformasi Beban) yang kompleks dan mengintegrasikan data gudang Snowflake yang ada dengan data lain Anda di Microsoft Fabric. Anda dapat terus mereplikasi data Snowflake yang ada langsung ke Fabric's OneLake. Di dalam Fabric, Anda dapat membuka kecerdasan bisnis yang kuat, kecerdasan buatan, Rekayasa Data, Ilmu Data, dan skenario berbagi data.

Untuk tutorial tentang mengonfigurasi database Snowflake Anda untuk Mirroring in Fabric, lihat Tutorial: Mengonfigurasi database cermin Microsoft Fabric dari Snowflake.

Mengapa menggunakan Mirroring in Fabric?

Dengan Mirroring in Fabric, Anda tidak perlu mengumpulkan layanan yang berbeda dari beberapa vendor. Sebagai gantinya, Anda dapat menikmati produk yang sangat terintegrasi, end-to-end, dan mudah digunakan yang dirancang untuk menyederhanakan kebutuhan analitik Anda, dan dibangun untuk keterbukaan dan kolaborasi antara Microsoft, Snowflake, dan 1000-an solusi teknologi yang dapat membaca format tabel Delta Lake sumber terbuka.

Pengalaman analitik apa yang sudah terintegrasi?

Database yang dicerminkan adalah item di Fabric Data Warehousing yang berbeda dari Gudang dan titik akhir analitik SQL.

Diagram pencerminan database Fabric untuk Snowflake.

Pencerminan membuat item ini di ruang kerja Fabric Anda:

  • Item database yang dicerminkan. Ini memungkinkan skenario hilir seperti rekayasa data, ilmu data, dan banyak lagi. Pencerminan mengelola:
    • Replikasi data tabel terkelola dan tampilan ke OneLake serta konversinya ke Parquet, dalam format yang siap untuk analitik.
    • Replikasi metadata tabel Iceberg ke OneLake melalui pintasan ke penyimpanan yang berisi tabel Iceberg Anda dan konversinya ke OneLake. OneLake secara otomatis mengonversi tabel Iceberg ini ke tabel berformat Delta Lake untuk digunakan di seluruh beban kerja Fabric.
  • Titik akhir analitik SQL

Penting

Dukungan tabel Iceberg: Jika Anda memilih untuk mencerminkan tabel Iceberg, Anda harus menyediakan koneksi penyimpanan ke penyimpanan dasar yang berisi data tabel Iceberg. Hanya tabel Iceberg yang dapat diakses melalui koneksi penyimpanan yang sama yang dapat dicerminkan secara bersamaan. Untuk menemukan lokasi penyimpanan untuk tabel Iceberg, jalankan fungsi sistem SYSTEM$GET_ICEBERG_TABLE_INFORMATION di Snowflake. Untuk informasi selengkapnya, lihat Tutorial: Mengonfigurasi database cermin Microsoft Fabric dari Snowflake.

Setiap database cermin memiliki titik akhir analitik SQL yang dibuat secara otomatis yang memberikan pengalaman analitik yang kaya di atas Tabel Delta yang dibuat oleh proses pencerminan. Pengguna memiliki akses ke perintah T-SQL yang familier yang dapat menentukan dan mengkueri objek data tetapi tidak memanipulasi data dari titik akhir analitik SQL, karena ini adalah salinan baca-saja. Anda dapat melakukan tindakan berikut di titik akhir analitik SQL:

  • Jelajahi tabel yang mereferensikan data dalam tabel Delta Lake Anda dari Snowflake.
  • Buat kueri dan tampilan tanpa kode dan jelajahi data secara visual tanpa menulis satu baris kode.
  • Kembangkan tampilan SQL, TVF sebaris (Fungsi Bernilai Tabel), dan prosedur tersimpan untuk merangkum semantik dan logika bisnis Anda di T-SQL.
  • Mengelola izin pada objek.
  • Kueri data di Gudang dan Lakehouse lain di ruang kerja yang sama.

Selain editor kueri SQL, ada ekosistem alat yang luas yang dapat mengkueri titik akhir analitik SQL, termasuk SQL Server Management Studio (SSMS), ekstensi MSSQL untuk Visual Studio Code, dan bahkan GitHub Copilot.

Jenis objek Snowflake yang didukung

Tabel berikut ini mencantumkan jenis objek Snowflake mana yang didukung untuk pencerminan:

Jenis objek Dukungan Catatan
Tabel yang dikelola Yes Didukung penuh untuk replikasi
Tabel Iceberg Yes Memerlukan koneksi penyimpanan ke penyimpanan tabel Iceberg yang mendasar. Anda hanya dapat mencerminkan tabel Iceberg yang dapat dijangkau melalui koneksi penyimpanan yang sama.
Views Yes Didukung dengan sinkronisasi setiap 12 jam
Tampilan Materialisasi Yes Didukung dengan sinkronisasi setiap 12 jam
Tabel eksternal Tidak. Tidak didukung
Tabel sementara Tidak. Tidak didukung
Tabel sementara Tidak. Tidak didukung
Tabel dinamis Tidak. Tidak didukung

Pertimbangan keamanan

Untuk mengaktifkan pencerminan Fabric, Anda memerlukan izin pengguna untuk database Snowflake Anda yang berisi izin berikut:

  • CREATE STREAM
  • SELECT table
  • SHOW tables
  • DESCRIBE tables

Untuk informasi selengkapnya, lihat dokumentasi Snowflake tentang Hak Istimewa Kontrol Akses untuk Tabel Streaming dan Persyaratan Izin untuk Stream.

Penting

Setiap keamanan granular yang diatur di gudang Snowflake asal harus dikustomisasi ulang di database cermin dalam Microsoft Fabric. Untuk informasi selengkapnya, lihat izin terperinci SQL di Microsoft Fabric.

Metode autentikasi yang didukung

Tabel berikut mencantumkan metode autentikasi mana yang didukung untuk pencerminan untuk Snowflake:

Metode autentikasi Dukungan Catatan
Nama pengguna dan kata sandi Yes Autentikasi bawaan Snowflake
Microsoft Entra ID (SSO) Yes Masuk sekali melalui Entra ID
Autentikasi pasangan kunci Yes Pasangan kunci RSA untuk skenario akun layanan
Identitas ruang kerja Tidak. Saat ini tidak didukung untuk Snowflake

Mencerminkan Snowflake di belakang firewall

Periksa persyaratan jaringan untuk mengakses sumber data Snowflake Anda. Jika sumber data Snowflake Anda tidak dapat diakses secara publik dan berada dalam jaringan privat, buat gateway data jaringan virtual atau instal gateway data lokal untuk mencerminkan data. Microsoft Azure Virtual Network atau jaringan komputer gateway harus terhubung ke instans Snowflake melalui titik akhir privat atau diizinkan oleh aturan firewall. Untuk memulai, lihat Tutorial: Mengonfigurasi database cermin Microsoft Fabric dari Snowflake.

Private Link dan identitas ruang kerja:

  • Private Link: Konektivitas Private Link langsung antara ruang kerja Fabric dan Snowflake belum didukung. Sementara itu, gunakan gateway data jaringan virtual atau gateway data lokal untuk konektivitas privat.
  • Identitas ruang kerja: Autentikasi identitas ruang kerja saat ini tidak didukung untuk fitur pencerminan Snowflake.

Pertimbangan Biaya untuk Replikasi Snowflake

Komputasi 'fabric' yang digunakan untuk mereplikasi data Anda ke 'Fabric OneLake' tidak dikenakan biaya. Biaya penyimpanan Mirroring bebas hingga batas berdasarkan kapasitas. Untuk informasi selengkapnya, lihat Biaya pencerminan dan Harga Microsoft Fabric. Komputasi untuk mengkueri data menggunakan SQL, Power BI, atau Spark dikenakan tarif reguler.

Fabric tidak membebankan biaya masuk data jaringan ke OneLake untuk Mirroring.

Ada biaya komputasi Snowflake dan biaya kueri cloud saat data direplikasi: komputasi gudang virtual dan komputasi layanan cloud.

  • Biaya komputasi gudang virtual Snowflake:
    • Biaya pemrosesan akan dikenakan di sisi Snowflake jika ada perubahan data yang dibaca di Snowflake, dan kemudian disinkronkan ke dalam Fabric.
    • Setiap kueri metadata yang berjalan di belakang layar untuk memeriksa perubahan data tidak dikenakan biaya untuk komputasi Snowflake apa pun; namun, kueri yang menghasilkan data seperti SELECT * akan membangunkan gudang Snowflake dan komputasi akan menghasilkan biaya.
  • Biaya penggunaan komputasi untuk layanan Snowflake
    • Meskipun tidak ada biaya komputasi untuk tugas di balik layar seperti penulisan, kueri metadata, kontrol akses, memperlihatkan perubahan data, dan bahkan kueri DDL, ada biaya cloud yang terkait dengan kueri ini.
    • Tergantung pada jenis edisi Snowflake yang Anda miliki, Anda akan dikenakan biaya kredit yang sesuai untuk biaya layanan cloud apa pun.

Dalam cuplikan layar berikut, Anda dapat melihat biaya komputasi gudang virtual dan komputasi layanan cloud untuk database Snowflake terkait yang sedang dicerminkan ke dalam Fabric. Dalam skenario ini, sebagian besar biaya komputasi layanan cloud (berwarna kuning) berasal dari kueri perubahan data berdasarkan poin yang disebutkan sebelumnya. Biaya komputasi gudang virtual (berwarna biru) datang hanya dari perubahan data yang sedang dibaca dari Snowflake dan direplikasi ke Fabric.

Cuplikan layar grafik biaya Snowflake.

Rekomendasi pengoptimalan biaya

Untuk meminimalkan biaya komputasi Snowflake dari pencerminan, pertimbangkan praktik terbaik berikut:

  • Gunakan kembali gudang yang ada. Alih-alih membuat gudang khusus untuk pencerminan, konfigurasikan pencerminan untuk menggunakan gudang yang sama dengan yang sudah digunakan aplikasi Anda untuk memperbarui tabel sumber. Pendekatan ini menghindari siklus aktivasi warehouse dan penangguhan otomatis yang tidak perlu. Ketika aplikasi Anda memperbarui tabel, replikator mirroring mendeteksi perubahan hampir seketika selagi warehouse masih aktif, sehingga Anda tidak perlu mengaktifkan warehouse terpisah. Beberapa organisasi mungkin lebih suka gudang khusus untuk isolasi anggaran. Preferensi ini adalah trade-off antara penghematan biaya dan granularitas anggaran.
  • Cerminkan hanya tabel yang Anda butuhkan. Menduplikasi seluruh database dapat menyebabkan peningkatan konsumsi Snowflake yang tidak terduga dan lonjakan penggunaan kapasitas Fabric. Mulailah dengan memilih hanya tabel yang diperlukan untuk skenario analitik Anda. Anda dapat menambahkan tabel nanti sesuai kebutuhan.
  • Pantau penyemaian ulang yang tidak terduga. Reseed (reload data penuh) memproses seluruh tabel dan menimbulkan biaya komputasi sebanding dengan ukuran tabel. Perubahan skema - termasuk yang dipicu oleh alat seperti DBT - dapat menyebabkan proses reseed terus-menerus. Pantau halaman Status Pencerminan untuk tabel yang memperlihatkan perilaku penyalinan awal berulang, dan tinjau bagian Reseeding di bawah ini untuk panduan pemicu dan pemecahan masalah.
  • Perlu diketahui bahwa pencerminan berjalan terus-menerus. Pencerminan saat ini tidak mendukung penjadwalan atau jendela replikasi. Replikator terus memeriksa perubahan, yang menghasilkan penggunaan komputasi Snowflake secara berkelanjutan. Rencanakan anggaran Snowflake Anda dengan tepat.

Untuk informasi selengkapnya mengenai biaya kueri cloud yang khusus untuk Snowflake, lihat dokumen Snowflake: Memahami biaya keseluruhan.

Langkah selanjutnya