Memahami proses ilmu data

Selesai

Cara umum untuk mengekstrak wawasan dari data adalah dengan memvisualisasikan data. Setiap kali Anda memiliki himpunan data yang kompleks, Anda mungkin ingin menyelam lebih dalam dan mencoba menemukan pola yang rumit dalam data.

Sebagai ilmuwan data, Anda dapat melatih model pembelajaran mesin untuk menemukan pola dalam data Anda. Anda dapat menggunakan pola tersebut untuk menghasilkan wawasan atau prediksi baru. Misalnya, Anda dapat memprediksi jumlah produk yang diharapkan untuk dijual dalam minggu mendatang.

Meskipun melatih model itu penting, ini bukan satu-satunya tugas dalam proyek ilmu data. Sebelum menjelajahi proses ilmu data yang khas, mari kita jelajahi model pembelajaran mesin umum yang dapat Anda latih.

Menjelajahi model pembelajaran mesin umum

Tujuan pembelajaran mesin adalah untuk melatih model yang dapat mengidentifikasi pola dalam sejumlah besar data. Anda kemudian dapat menggunakan pola untuk membuat prediksi yang memberi Anda wawasan baru di mana Anda dapat mengambil tindakan.

Kemungkinan dengan pembelajaran mesin mungkin muncul tanpa akhir, jadi mari kita mulai dengan memahami empat jenis umum model pembelajaran mesin:

Diagram empat jenis umum model pembelajaran mesin.

  1. Klasifikasi: Memprediksi nilai kategoris seperti apakah pelanggan mungkin akan berhenti.
  2. Regresi: Memprediksi nilai numerik seperti harga produk.
  3. Pengklusteran: Mengelompokkan titik data serupa ke dalam kluster atau grup.
  4. Prakiraan: Memprediksi nilai numerik di masa mendatang berdasarkan data rangkaian waktu seperti penjualan yang diharapkan untuk bulan mendatang.

Untuk memutuskan jenis model pembelajaran mesin mana yang perlu Anda latih, Anda harus terlebih dahulu memahami masalah bisnis dan data yang tersedia untuk Anda.

Memahami proses ilmu data

Untuk melatih model pembelajaran mesin, prosesnya biasanya melibatkan langkah-langkah berikut:

Diagram langkah berurutan dalam proses ilmu data.

  1. Tentukan masalah: Bersama dengan pengguna bisnis dan analis, putuskan apa yang harus diprediksi model dan kapan berhasil.
  2. Dapatkan data: Temukan sumber data dan dapatkan akses dengan menyimpan data Anda di Lakehouse.
  3. Siapkan data: Jelajahi data dengan membacanya dari Lakehouse ke dalam notebook. Bersihkan dan ubah data berdasarkan persyaratan model.
  4. Latih model: Pilih nilai algoritma dan hiperparameter berdasarkan uji coba dan kesalahan dengan melacak eksperimen Anda dengan MLflow.
  5. Hasilkan wawasan: Gunakan penilaian batch model untuk menghasilkan prediksi yang diminta.

Sebagai ilmuwan data, sebagian besar waktu Anda dihabiskan untuk menyiapkan data dan melatih model. Bagaimana Anda menyiapkan data dan algoritma mana yang Anda pilih untuk melatih model dapat memengaruhi keberhasilan model Anda.

Anda dapat menyiapkan dan melatih model dengan menggunakan pustaka sumber terbuka yang tersedia untuk bahasa pilihan Anda. Misalnya, jika Anda bekerja dengan Python, Anda dapat menyiapkan data dengan Pandas dan Numpy, dan melatih model dengan pustaka seperti Scikit-Learn, PyTorch, atau SynapseML.

Saat bereksperimen, Anda ingin menyimpan gambaran umum semua model berbeda yang telah Anda latih. Anda ingin memahami bagaimana pilihan Anda memengaruhi kesuksesan model. Dengan melacak eksperimen Anda dengan MLflow di Microsoft Fabric, Anda dapat dengan mudah mengelola dan menyebarkan model yang telah Anda latih.