Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Gunakan panduan referensi ini dan contoh skenario untuk membantu Anda dalam memutuskan apakah Anda memerlukan aktivitas salin, Pekerjaan salin, aliran data, Eventstream, atau Spark untuk beban kerja Microsoft Fabric Anda.
Aktivitas salin, Pekerjaan salin, aliran data, Eventstream, dan properti Spark
| aktivitas penyalinan alur | Pekerjaan penyalinan | Aliran Data Gen 2 | Eventstream | Cahaya | |
|---|---|---|---|---|---|
| kasus penggunaan | Migrasi data lake dan gudang data, penyerapan data, transformasi ringan |
Penyerapan Data, Salinan bertahap bertingkat Replikasi Migrasi Data Lake dan Gudang Data, transformasi ringan |
Penyerapan data, transformasi data, pengolahan data pembuatan profil data |
penyerapan data peristiwa, transformasi data peristiwa |
Penyerapan data, transformasi data, pemrosesan data, pembuatan profil data |
| Persona pengembang utama | Teknisi Data pengintegrasi data |
Analis Bisnis, Pengintegrasi Data Insinyur Data |
Teknisi Data integrator data analis bisnis |
Teknisi Data ilmuwan data pengembang data |
Integrator Data teknisi data |
| Set keterampilan utama pengembang | ETL, SQL JSON |
ETL, SQL JSON |
ETL, M, SQL |
SQL, JSON, olahpesan | Spark (Scala, Python, Spark SQL, R) |
| Code ditulis | Tidak ada kode, pengembangan aplikasi tanpa kode |
Tidak ada kode, pengembangan aplikasi tanpa kode |
Tidak ada kode, pengembangan aplikasi tanpa kode |
Tanpa Kode, pengembangan aplikasi tanpa kode |
Kode |
| volume data | Rendah ke tinggi | Rendah ke tinggi | Rendah ke tinggi | Menengah hingga Tinggi | Rendah ke tinggi |
| antarmuka pengembangan | Penyihir kanvas |
Penyihir kanvas |
Power Query | Kanvas | Buku catatan Definisi kerja Spark |
| Sumber | 50+ konektor | 50+ konektor | 150+ konektor | Database yang mendukung CDC (Ubah Pengambilan Data), Kafka, Sistem Olahpesan yang mendukung pola penerbitan dan langganan, Aliran peristiwa | Ratusan pustaka Spark |
| Tujuan | Lebih dari 40 penghubung | Lebih dari 40 penghubung | Lakehouse, Azure SQL Database Azure Data Explorer Analisis Azure Synapse |
Eventhouse, Lakehouse, Pemberitahuan Aktivator, Aliran Turunan, Titik Akhir Kustom | Ratusan pustaka Spark |
| kompleksitas transformasi | Rendah: ringan - konversi jenis, pemetaan kolom, gabungkan/pisahkan file, ratakan hierarki |
Rendah: ringan - konversi jenis, pemetaan kolom, gabungkan/pisahkan file, ratakan hierarki |
Rendah ke tinggi: 300+ fungsi transformasi |
Rendah: ringan |
Rendah ke tinggi: dukungan untuk Spark dan pustaka sumber terbuka asli |
Skenario
Tinjau skenario berikut untuk bantuan dalam memilih cara bekerja dengan data Anda di Fabric.
Skenario 1
Leo, seorang teknisi data, perlu menyerap data dalam jumlah besar dari sistem eksternal, baik lokal maupun cloud. Sistem eksternal ini mencakup database, sistem file, dan API. Leo tidak ingin menulis dan memelihara kode untuk setiap operasi konektor atau pemindahan data. Dia ingin mengikuti praktik terbaik lapisan medali, dengan perunggu, perak, dan emas. Leo tidak memiliki pengalaman dengan Spark, jadi dia lebih suka antarmuka seret-dan-jatuhkan sebanyak mungkin, dengan pengodean minimal. Dan dia juga ingin memproses data sesuai jadwal.
Langkah pertama adalah memasukkan data mentah ke dalam lakehouse lapisan perunggu dari sumber daya data Azure dan berbagai sumber pihak ketiga (seperti Snowflake Web, REST, AWS S3, GCS, dll.). Dia menginginkan lakehouse yang terkonsolidasi, sehingga semua data dari berbagai sumber LOB (Line of Business), on-premises, dan cloud berada di satu tempat. Leo meninjau opsi dan memilih aktivitas penyalinan alur sebagai pilihan yang sesuai untuk salinan biner mentahnya. Pola ini berlaku untuk penyegaran data historis dan penyegaran data bertahap. Dengan aktivitas penyalinan, Leo dapat memuat data emas ke dalam gudang data tanpa perlu penulisan kode jika diperlukan, dan pipeline menyediakan penyerapan data berskala tinggi yang mampu memindahkan data dengan skala petabyte. Aktivitas penyalinan adalah pilihan terbaik dengan sedikit kode atau tanpa kode untuk memindahkan petabyte data ke lakehouse dan gudang dari berbagai sumber, baik secara ad-hoc atau dijadwalkan.
Skenario 2
Mary adalah insinyur data dengan pengetahuan mendalam tentang beberapa persyaratan pelaporan analitik LOB. Tim hulu telah berhasil menerapkan solusi untuk memigrasikan beberapa data historis dan inkremental LOB ke dalam lakehouse umum. Mary ditugaskan untuk membersihkan data, menerapkan logika bisnis, dan memuatnya ke berbagai tujuan (seperti Azure SQL Database, ADX, dan sebuah lakehouse) sebagai persiapan untuk tim pelaporan masing-masing.
Mary adalah pengguna Power Query berpengalaman, dan volume data berada dalam rentang rendah hingga menengah untuk mencapai performa yang diinginkan. Aliran data menyediakan antarmuka tanpa kode atau kode rendah untuk menyerap data dari ratusan sumber data. Dengan aliran data, Anda dapat mengubah data menggunakan opsi transformasi data 300+, dan menulis hasilnya ke beberapa tujuan dengan antarmuka pengguna yang mudah digunakan dan sangat visual. Mary meninjau opsi dan memutuskan bahwa masuk akal untuk menggunakan Dataflow Gen 2 sebagai opsi transformasi pilihannya.
Skenario 3
Prashant, integrator data dengan keahlian mendalam dalam proses dan sistem bisnis. Tim upstream telah berhasil mengekspos data peristiwa dari aplikasi bisnis sebagai pesan yang dapat dikonsumsi melalui sistem hilir. Prashant telah ditetapkan untuk mengintegrasikan data peristiwa dari aplikasi bisnis ke Microsoft Fabric untuk dukungan keputusan real time.
Mengingat volume data menengah hingga tinggi dan preferensi organisasi untuk solusi tanpa kode, Prashant mencari cara untuk meneruskan peristiwa dengan mulus saat terjadi tanpa mengelola jadwal ekstraksi. Untuk memenuhi kebutuhan ini, ia memilih Eventstreams di Microsoft Fabric. Eventstreams di Real-Time Intelligence memungkinkan penyerapan, transformasi, dan perutean data secara real time ke berbagai tujuan—semuanya tanpa perlu menulis kode apa pun.
Skenario 4
Adam adalah insinyur data yang bekerja untuk perusahaan ritel besar yang menggunakan lakehouse untuk menyimpan dan menganalisis data pelanggannya. Sebagai bagian dari pekerjaannya, Adam bertanggung jawab untuk membangun dan memelihara alur yang mengekstrak, mengubah, dan memuat data ke lakehouse. Salah satu persyaratan bisnis perusahaan adalah melakukan analitik ulasan pelanggan untuk mendapatkan wawasan tentang pengalaman pelanggan mereka dan meningkatkan layanan mereka.
Adam memutuskan opsi terbaik adalah menggunakan Spark untuk membangun logika ekstrak dan transformasi. Spark menyediakan platform komputasi terdistribusi yang dapat memproses data dalam jumlah besar secara paralel. Dia menulis aplikasi Spark menggunakan Python atau Scala, yang membaca data terstruktur, semi terstruktur, dan tidak terstruktur dari OneLake untuk ulasan dan umpan balik pelanggan. Aplikasi membersihkan, mengubah, dan menulis data ke tabel Delta di lakehouse. Data kemudian siap digunakan untuk analitik hilir.
Skenario 5
Rajesh, seorang insinyur data, ditugaskan untuk menyerap data inkremental dari SQL Server lokal ke dalam Azure SQL Database. Instans SQL Server Lokal Rajesh sudah mengaktifkan Change Data Capture (CDC) pada tabel kunci.
Rajesh mencari solusi sederhana, berkode rendah, berbasis wizard yang memungkinkannya untuk:
- Pilih beberapa tabel sumber bawaan yang diaktifkan CDC
- Melakukan pemuatan penuh awal
- Secara otomatis beralih ke pemuatan data bertahap berdasarkan CDC.
- Menjadwalkan refresh data untuk pembaruan berulang
Dia ingin menghindari penulisan kode kustom atau mengelola orkestrasi yang kompleks. Idealnya, dia menginginkan "wizard 5x5" di mana dia dapat menyelesaikan pengaturan hanya dengan beberapa klik.
Rajesh memilih fitur Salin pekerjaan di Microsoft Fabric. Dengan dukungan gateway lokal, ia terhubung dengan aman ke SQL Server-nya, memilih tabel yang diinginkan, dan mengonfigurasi alur untuk masuk ke Target Azure SQL Database.
Tugas Copy menyediakan pengalaman pemindahan data yang minim hambatan dan dapat diskalakan, memenuhi kebutuhan Rajesh tanpa perlu mengelola pipeline yang kompleks.