Panduan keputusan Microsoft Fabric: aktivitas salin, Pekerjaan salin, aliran data, Eventstream, atau Spark

Gunakan panduan referensi ini dan contoh skenario untuk membantu Anda dalam memutuskan apakah Anda memerlukan aktivitas salin, Pekerjaan salin, aliran data, Eventstream, atau Spark untuk beban kerja Microsoft Fabric Anda.

Aktivitas salin, Pekerjaan salin, aliran data, Eventstream, dan properti Spark

aktivitas penyalinan alur Pekerjaan penyalinan Aliran Data Gen 2 Eventstream Cahaya
kasus penggunaan Migrasi data lake dan gudang data,
penyerapan data,
transformasi ringan
Penyerapan Data,
Salinan bertahap bertingkat
Replikasi
Migrasi Data Lake dan Gudang Data,
transformasi ringan
Penyerapan data,
transformasi data,
pengolahan data
pembuatan profil data
penyerapan data peristiwa,
transformasi data peristiwa
Penyerapan data,
transformasi data,
pemrosesan data,
pembuatan profil data
Persona pengembang utama Teknisi Data
pengintegrasi data
Analis Bisnis,
Pengintegrasi Data
Insinyur Data
Teknisi Data
integrator data
analis bisnis
Teknisi Data
ilmuwan data
pengembang data
Integrator Data
teknisi data
Set keterampilan utama pengembang ETL,
SQL
JSON
ETL,
SQL
JSON
ETL,
M,
SQL
SQL, JSON, olahpesan Spark (Scala, Python, Spark SQL, R)
Code ditulis Tidak ada kode,
pengembangan aplikasi tanpa kode
Tidak ada kode,
pengembangan aplikasi tanpa kode
Tidak ada kode,
pengembangan aplikasi tanpa kode
Tanpa Kode,
pengembangan aplikasi tanpa kode
Kode
volume data Rendah ke tinggi Rendah ke tinggi Rendah ke tinggi Menengah hingga Tinggi Rendah ke tinggi
antarmuka pengembangan Penyihir
kanvas
Penyihir
kanvas
Power Query Kanvas Buku catatan
Definisi kerja Spark
Sumber 50+ konektor 50+ konektor 150+ konektor Database yang mendukung CDC (Ubah Pengambilan Data), Kafka, Sistem Olahpesan yang mendukung pola penerbitan dan langganan, Aliran peristiwa Ratusan pustaka Spark
Tujuan Lebih dari 40 penghubung Lebih dari 40 penghubung Lakehouse,
Azure SQL Database
Azure Data Explorer
Analisis Azure Synapse
Eventhouse, Lakehouse, Pemberitahuan Aktivator, Aliran Turunan, Titik Akhir Kustom Ratusan pustaka Spark
kompleksitas transformasi Rendah:
ringan - konversi jenis, pemetaan kolom, gabungkan/pisahkan file, ratakan hierarki
Rendah:
ringan - konversi jenis, pemetaan kolom, gabungkan/pisahkan file, ratakan hierarki
Rendah ke tinggi:
300+ fungsi transformasi
Rendah:
ringan
Rendah ke tinggi:
dukungan untuk Spark dan pustaka sumber terbuka asli

Skenario

Tinjau skenario berikut untuk bantuan dalam memilih cara bekerja dengan data Anda di Fabric.

Skenario 1

Leo, seorang teknisi data, perlu menyerap data dalam jumlah besar dari sistem eksternal, baik lokal maupun cloud. Sistem eksternal ini mencakup database, sistem file, dan API. Leo tidak ingin menulis dan memelihara kode untuk setiap operasi konektor atau pemindahan data. Dia ingin mengikuti praktik terbaik lapisan medali, dengan perunggu, perak, dan emas. Leo tidak memiliki pengalaman dengan Spark, jadi dia lebih suka antarmuka seret-dan-jatuhkan sebanyak mungkin, dengan pengodean minimal. Dan dia juga ingin memproses data sesuai jadwal.

Langkah pertama adalah memasukkan data mentah ke dalam lakehouse lapisan perunggu dari sumber daya data Azure dan berbagai sumber pihak ketiga (seperti Snowflake Web, REST, AWS S3, GCS, dll.). Dia menginginkan lakehouse yang terkonsolidasi, sehingga semua data dari berbagai sumber LOB (Line of Business), on-premises, dan cloud berada di satu tempat. Leo meninjau opsi dan memilih aktivitas penyalinan alur sebagai pilihan yang sesuai untuk salinan biner mentahnya. Pola ini berlaku untuk penyegaran data historis dan penyegaran data bertahap. Dengan aktivitas penyalinan, Leo dapat memuat data emas ke dalam gudang data tanpa perlu penulisan kode jika diperlukan, dan pipeline menyediakan penyerapan data berskala tinggi yang mampu memindahkan data dengan skala petabyte. Aktivitas penyalinan adalah pilihan terbaik dengan sedikit kode atau tanpa kode untuk memindahkan petabyte data ke lakehouse dan gudang dari berbagai sumber, baik secara ad-hoc atau dijadwalkan.

Skenario 2

Mary adalah insinyur data dengan pengetahuan mendalam tentang beberapa persyaratan pelaporan analitik LOB. Tim hulu telah berhasil menerapkan solusi untuk memigrasikan beberapa data historis dan inkremental LOB ke dalam lakehouse umum. Mary ditugaskan untuk membersihkan data, menerapkan logika bisnis, dan memuatnya ke berbagai tujuan (seperti Azure SQL Database, ADX, dan sebuah lakehouse) sebagai persiapan untuk tim pelaporan masing-masing.

Mary adalah pengguna Power Query berpengalaman, dan volume data berada dalam rentang rendah hingga menengah untuk mencapai performa yang diinginkan. Aliran data menyediakan antarmuka tanpa kode atau kode rendah untuk menyerap data dari ratusan sumber data. Dengan aliran data, Anda dapat mengubah data menggunakan opsi transformasi data 300+, dan menulis hasilnya ke beberapa tujuan dengan antarmuka pengguna yang mudah digunakan dan sangat visual. Mary meninjau opsi dan memutuskan bahwa masuk akal untuk menggunakan Dataflow Gen 2 sebagai opsi transformasi pilihannya.

Skenario 3

Prashant, integrator data dengan keahlian mendalam dalam proses dan sistem bisnis. Tim upstream telah berhasil mengekspos data peristiwa dari aplikasi bisnis sebagai pesan yang dapat dikonsumsi melalui sistem hilir. Prashant telah ditetapkan untuk mengintegrasikan data peristiwa dari aplikasi bisnis ke Microsoft Fabric untuk dukungan keputusan real time.

Mengingat volume data menengah hingga tinggi dan preferensi organisasi untuk solusi tanpa kode, Prashant mencari cara untuk meneruskan peristiwa dengan mulus saat terjadi tanpa mengelola jadwal ekstraksi. Untuk memenuhi kebutuhan ini, ia memilih Eventstreams di Microsoft Fabric. Eventstreams di Real-Time Intelligence memungkinkan penyerapan, transformasi, dan perutean data secara real time ke berbagai tujuan—semuanya tanpa perlu menulis kode apa pun.

Skenario 4

Adam adalah insinyur data yang bekerja untuk perusahaan ritel besar yang menggunakan lakehouse untuk menyimpan dan menganalisis data pelanggannya. Sebagai bagian dari pekerjaannya, Adam bertanggung jawab untuk membangun dan memelihara alur yang mengekstrak, mengubah, dan memuat data ke lakehouse. Salah satu persyaratan bisnis perusahaan adalah melakukan analitik ulasan pelanggan untuk mendapatkan wawasan tentang pengalaman pelanggan mereka dan meningkatkan layanan mereka.

Adam memutuskan opsi terbaik adalah menggunakan Spark untuk membangun logika ekstrak dan transformasi. Spark menyediakan platform komputasi terdistribusi yang dapat memproses data dalam jumlah besar secara paralel. Dia menulis aplikasi Spark menggunakan Python atau Scala, yang membaca data terstruktur, semi terstruktur, dan tidak terstruktur dari OneLake untuk ulasan dan umpan balik pelanggan. Aplikasi membersihkan, mengubah, dan menulis data ke tabel Delta di lakehouse. Data kemudian siap digunakan untuk analitik hilir.

Skenario 5

Rajesh, seorang insinyur data, ditugaskan untuk menyerap data inkremental dari SQL Server lokal ke dalam Azure SQL Database. Instans SQL Server Lokal Rajesh sudah mengaktifkan Change Data Capture (CDC) pada tabel kunci.

Rajesh mencari solusi sederhana, berkode rendah, berbasis wizard yang memungkinkannya untuk:

  • Pilih beberapa tabel sumber bawaan yang diaktifkan CDC
  • Melakukan pemuatan penuh awal
  • Secara otomatis beralih ke pemuatan data bertahap berdasarkan CDC.
  • Menjadwalkan refresh data untuk pembaruan berulang

Dia ingin menghindari penulisan kode kustom atau mengelola orkestrasi yang kompleks. Idealnya, dia menginginkan "wizard 5x5" di mana dia dapat menyelesaikan pengaturan hanya dengan beberapa klik.

Rajesh memilih fitur Salin pekerjaan di Microsoft Fabric. Dengan dukungan gateway lokal, ia terhubung dengan aman ke SQL Server-nya, memilih tabel yang diinginkan, dan mengonfigurasi alur untuk masuk ke Target Azure SQL Database.

Tugas Copy menyediakan pengalaman pemindahan data yang minim hambatan dan dapat diskalakan, memenuhi kebutuhan Rajesh tanpa perlu mengelola pipeline yang kompleks.