Menjelajahi dan memproses data dengan Microsoft Fabric
Data adalah landasan ilmu data, terutama ketika bertujuan untuk melatih model pembelajaran mesin untuk mencapai kecerdasan buatan. Biasanya, model menunjukkan performa yang ditingkatkan saat ukuran himpunan data pelatihan meningkat. Selain kuantitas data, kualitas data sama pentingnya.
Untuk menjamin kualitas dan kuantitas data Anda, menggunakan mesin penyerapan dan pemrosesan data Microsoft Fabric yang kuat sangat berharga. Anda memiliki fleksibilitas untuk memilih pendekatan kode rendah atau kode-pertama saat membuat saluran penyerapan, eksplorasi, dan transformasi data penting.
Menyerap data Anda ke Microsoft Fabric
Untuk bekerja dengan data di Microsoft Fabric, Anda harus terlebih dahulu menyerap data. Anda dapat menyerap data dari beberapa sumber, baik sumber data lokal maupun cloud. Misalnya, Anda dapat menyerap data dari file CSV yang disimpan di komputer lokal Anda atau di Azure Data Lake Storage (Gen2).
Petunjuk / Saran
Pelajari selengkapnya tentang cara menyerap dan mengatur data dari berbagai sumber dengan Microsoft Fabric.
Setelah menyambungkan ke sumber data, Anda dapat menyimpan data ke microsoft Fabric lakehouse. Anda dapat menggunakan lakehouse sebagai lokasi pusat untuk menyimpan file terstruktur, semi terstruktur, dan tidak terstruktur. Anda kemudian dapat dengan mudah terhubung ke lakehouse kapan pun Anda ingin mengakses data Anda untuk eksplorasi atau transformasi.
Menjelajahi dan mengubah data Anda
Sebagai ilmuwan data, Anda mungkin paling akrab dengan menulis dan mengeksekusi kode di buku catatan. Microsoft Fabric menawarkan pengalaman notebook yang familier, didukung oleh komputasi Spark.
Apache Spark adalah kerangka kerja pemrosesan paralel sumber terbuka untuk pemrosesan dan analitik data skala besar.
Notebook secara otomatis dilampirkan ke komputasi Spark. Saat Anda menjalankan sel di buku catatan untuk pertama kalinya, sesi Spark baru dimulai. Sesi tetap ada saat Anda menjalankan sel berikutnya. Sesi Spark akan secara otomatis berhenti setelah beberapa waktu tidak aktif untuk menghemat biaya. Anda juga dapat menghentikan sesi secara manual.
Saat Anda bekerja di buku catatan, Anda bisa memilih bahasa yang ingin Anda gunakan. Untuk beban kerja ilmu data, Anda mungkin bekerja dengan PySpark (Python) atau SparkR (R).
Dalam buku catatan, Anda dapat menjelajahi data menggunakan pustaka pilihan Anda, atau dengan salah satu opsi visualisasi bawaan. Jika perlu, Anda dapat mengubah data Anda dan menyimpan data yang diproses dengan menulisnya kembali ke lakehouse.
Menyiapkan data Anda dengan Wrangler Data
Untuk membantu Anda menjelajahi dan mengubah data Anda dengan lebih cepat, Microsoft Fabric menawarkan Data Wrangler yang mudah digunakan.
Setelah meluncurkan Data Wrangler, Anda akan mendapatkan gambaran umum deskriptif tentang data yang sedang Anda kerjakan. Anda dapat melihat statistik ringkasan data Anda untuk menemukan masalah seperti nilai yang hilang.
Untuk membersihkan data, Anda dapat memilih salah satu operasi pembersihan data bawaan. Saat Anda memilih operasi, pratinjau hasil dan kode terkait secara otomatis dibuat untuk Anda. Ketika Anda telah memilih semua operasi yang diperlukan, Anda dapat mengekspor transformasi ke kode dan menjalankannya pada data Anda.