Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Setelah Menyerap data ke Microsoft Fabric, Anda biasanya perlu membersihkan, membentuk, dan memperkayanya sebelum analisis. Apakah tujuan Anda adalah menyiapkan tabel terkurasi dalam lakehouse atau data siap-model di pusat data, Fabric menyediakan opsi transformasi tanpa-kode dan berfokus pada kode.
Artikel ini menjelaskan cara menggunakan Dataflow Gen2 untuk persiapan data visual dan kode rendah dan cara menggunakan notebook dan fungsi data pengguna untuk transformasi tingkat lanjut berbasis kode. Pilih pendekatan yang paling sesuai dengan peran, set keterampilan, dan persyaratan beban kerja Anda.
Mengubah data dengan Dataflow Gen2
Untuk persiapan data kode rendah, gunakan Dataflow Gen2. Dataflow Gen2 menggunakan pengalaman Power Query yang sudah tidak asing lagi, teknologi yang sama dengan yang digunakan di Excel dan Power BI.
Dengan antarmuka Power Query, Anda bisa menerapkan filter, memperoleh kolom, mengagregasi data, menggabungkan kueri, dan melakukan transformasi lainnya melalui alur kerja visual langkah demi langkah. Dalam Fabric, Dataflow Gen2 dapat berjalan sebagai proses ETL mandiri atau sebagai aktivitas dalam alur.
Misalnya, setelah Anda menyerap data penjualan yang belum diproses ke Lakehouse, Anda dapat menggunakan aliran data untuk menghapus duplikat, menstandarisasi nama kolom, menerapkan aturan bisnis, dan menulis hasil yang dibersihkan ke tabel terkurasi di lapisan Emas Lakehouse atau ke Warehouse.
Dataflow Gen2 berjalan di cloud dengan menggunakan kapasitas Fabric, memungkinkannya untuk menskalakan ke himpunan data besar dan transformasi kompleks tanpa memerlukan kode kustom. Analis data dan pengembang BI dapat menyiapkan data secara independen, sambil tetap menulis output ke tabel Lakehouse atau Gudang sebagai bagian dari fondasi penyimpanan terpadu Fabric.
Persiapan code-first dengan notebook dan fungsi data pengguna
Untuk skenario transformasi tingkat lanjut dengan kode, gunakan notebook, pekerjaan Spark, dan fungsi data pengguna dalam pengalaman Rekayasa Data.
Notebook Fabric menyediakan lingkungan bergaya Jupyter di portal Fabric. Anda dapat menulis kode dalam bahasa seperti Python, T-SQL, atau Scala untuk bekerja dengan data yang disimpan di OneLake.
Notebook sangat cocok untuk transformasi kompleks, algoritma kustom, alur kerja ilmu data, dan integrasi dengan pustaka eksternal. Misalnya, Anda dapat memuat file JSON atau Parquet mentah dari lakehouse ke dalam Spark DataFrame, menggabungkannya dengan himpunan data lain, menerapkan agregasi berjendela, memperkaya data, dan menyimpan hasilnya kembali sebagai tabel Delta di OneLake.
Notebook terintegrasi langsung dengan lakehouse dan gudang di ruang kerja yang sama. Anda dapat membaca dan menulis data tanpa konfigurasi kredensial tambahan karena operasi berjalan dalam konteks keamanan Fabric. Anda juga dapat mengatur dan menjadwalkan buku catatan dengan menggunakan aktivitas buku catatan di alur Data Factory.
Fungsi data pengguna Fabric memungkinkan Anda merangkum logika Python yang dapat digunakan kembali di Fabric. Anda dapat menggunakannya untuk menerapkan aturan bisnis tingkat lanjut, memanggil layanan eksternal, atau membangun komponen transformasi modular. Fungsi data pengguna mendukung pustaka PyPI, dapat terhubung ke sumber data Fabric, dan dapat mengekspos titik akhir REST untuk integrasi eksternal. Kemampuan ini membuatnya cocok untuk skenario perusahaan yang memerlukan logika transformasi yang dapat digunakan kembali dan diatur.
Anda dapat memanggil Fungsi Data Pengguna dari Buku Catatan, Pipeline, aturan aktivator, dan sebagai bagian dari alur tugas Translytical dalam laporan Power BI.