Ganti Nilai Diskrit

Penting

Dukungan untuk Studio Azure Machine Learning (klasik) akan berakhir pada 31 Agustus 2024. Sebaiknya Anda transisi ke Azure Machine Learning sebelum tanggal tersebut.

Mulai 1 Desember 2021, Anda tidak akan dapat membuat sumber daya Studio Azure Machine Learning (klasik) baru. Hingga 31 Agustus 2024, Anda dapat terus menggunakan sumber daya Pembelajaran Mesin Studio (klasik) yang ada.

ML Dokumentasi Studio (klasik) sedang berhenti dan mungkin tidak diperbarui di masa mendatang.

Mengganti nilai diskrit dari satu kolom dengan nilai numerik berdasarkan kolom lain

Kategori: Fungsi Statistik

Catatan

Berlaku untuk: Pembelajaran Mesin Studio (klasik) saja

Modul drag-and-drop serupa tersedia di Azure Machine Learning desainer.

Ringkasan Modul

Artikel ini menjelaskan cara menggunakan modul Ganti Nilai Diskrit di Pembelajaran Mesin Studio (klasik), untuk menghasilkan skor probabilitas yang dapat digunakan untuk mewakili nilai diskrit. Skor ini dapat berguna untuk memahami nilai informasi dari nilai diskrit.

Cara kerjanya:

Anda memilih kolom yang berisi nilai diskrit (atau kategoris), lalu pilih kolom lain untuk digunakan untuk referensi.

Bergantung pada apakah kolom kedua bersifat kategoris atau non-kategoris, modul menghitung salah satu nilai berikut:

  • Probabilitas bersyarat untuk kolom kedua diberikan nilai di kolom pertama.
  • Deviasi rata-rata dan standar untuk setiap kelompok nilai di kolom pertama.

Modul ini mengeluarkan himpunan data dengan skor, dan fungsi yang dapat Anda simpan dan terapkan ke himpunan data lain.

Cara mengkonfigurasi Ganti Nilai Diskrit

Tip

Sebaiknya bekerja hanya dengan satu pasang kolom sekaligus. Modul tidak menimbulkan kesalahan jika Anda memilih beberapa kolom untuk dianalisis. Namun, dalam praktiknya, jika Anda memilih beberapa kolom, mereka dicocokkan dengan heuristik internal, bukan berdasarkan urutan seleksi.

Oleh karena itu, kami sarankan Anda memilih satu pasang kolom setiap kali, satu untuk kolom Diskrit dan satu untuk kolom Penggantian.

Jika Anda perlu menghasilkan skor untuk beberapa kolom, gunakan instans terpisah dari Ganti Nilai Diskrit.

  1. Tambahkan modul Ganti Nilai Diskrit ke eksperimen Anda. Anda dapat menemukan modul ini di grup Fungsi Statistik dalam daftar item eksperimen di Pembelajaran Mesin Studio (klasik).

  2. Koneksi himpunan data yang berisi setidaknya satu kolom data kategoris.

  3. Kolom diskrit: Klik Pemilih kolom Peluncuran untuk memilih kolom yang berisi nilai diskrit (atau kategoris).

    Setiap kolom diskrit yang Anda pilih harus kategoris. Jika Anda mengalami kesalahan, gunakan modul Edit Metadata untuk mengubah tipe kolom.

  4. Kolom pengganti: Klik Pemilih kolom peluncuran untuk memilih kolom yang berisi nilai yang akan digunakan dalam menghitung skor pengganti.

    Jika Anda memilih beberapa kolom untuk kolom Diskrit, Anda harus memilih jumlah kolom pengganti yang sama.

  5. Jalankan eksperimen.

    Catatan

    Anda tidak dapat memilih fungsi statistik mana yang akan diterapkan. Modul menghitung ukuran yang sesuai, berdasarkan tipe data kolom yang dipilih untuk kolom Penggantian.

Hasil

Modul menghitung salah satu nilai berikut untuk setiap pasangan kolom:

  • Jika kolom kedua berisi nilai kategoris, modul menghitung probabilitas bersyarat kolom kedua, mengingat nilai di kolom pertama.

    Misalnya, asumsikan Anda memilih occupation dari himpunan data Sensus sebagai kolom diskrit dan pilih gender sebagai kolom pengganti. Output dari modul akan menjadi:

    P(gender | occupation)

  • Jika kolom kedua berisi nilai non-kategoris yang dapat dikonversi menjadi angka (seperti nilai numerik atau Boolean yang tidak ditandai sebagai kategoris), modul mengeluarkan rata-rata dan deviasi standar untuk setiap kelompok nilai di kolom pertama.

    Misalnya, asumsikan Anda menggunakan occupation sebagai kolom Diskrit dan kolom lainnya adalah kolom hours-per-weeknumerik . Modul akan mengeluarkan nilai-nilai baru ini:

    Mean(hours-per-week | occupation)

    Std-Dev(hours-per-week | occupation)

Selain skor probabilitas, modul juga menghasilkan dataset yang diubah. Dalam himpunan data ini, kolom yang dipilih sebagai kolom Penggantian diganti dengan kolom yang berisi skor yang dihitung.

Tip

Kolom dalam himpunan data sumber tidak benar-benar diubah atau dihapus oleh operasi; kolom skor adalah kolom baru yang dihasilkan oleh modul dan output, bukan data sumber.

Untuk melihat nilai sumber bersama dengan skor probabilitas, gunakan modul Tambahkan Kolom .

Contoh

Penggunaan Ganti Nilai Diskrit dapat diilustrasikan dengan beberapa contoh sederhana.

Contoh 1 - Ganti nilai kategoris dengan skor probabilitas

Tabel berikut berisi kolom kategoris X, dan kolom Y dengan nilai True/False yang diperlakukan sebagai nilai kategoris. Saat Anda menggunakan Ganti Nilai Diskrit, itu menghitung skor probabilitas bersyarat untuk probabilitas Y yang diberikan X, seperti yang ditunjukkan pada kolom ketiga.

X Y P(Y| X)
Biru 0 P(Y=0|X=Blue) = 0.5
Biru 1 P(Y=1|X=Blue) = 0.5
Hijau 0 P(Y=0|X=Green) = 2/3
Hijau 0 P(Y=0|X=Green) = 2/3
Hijau 1 P(Y=1|X=Green) = 1/3
Merah 0 P(Y=0|X=Red) = .75
Merah 0 P(Y=0|X=Red) = .75
Merah 1 P(Y=1|X=Red) = .25
Merah 0 P(Y=0|X=Red) = .75

Contoh 2 - Hitung rata-rata dan deviasi standar berdasarkan kolom nonkategoris

Ketika kolom kedua numerik, Ganti Nilai Diskrit menghitung rata-rata dan deviasi standar alih-alih skor probabilitas bersyarat.

Contoh berikut didasarkan pada himpunan data sampel Harga Otomatis , disederhanakan sebagai berikut:

  • Sebagian kecil kolom dipilih.

  • Hanya 30 baris teratas yang diekstraksi, dengan menggunakan opsi Kepala modul Partisi dan Sampel .

  • Modul Ganti Nilai Diskrit digunakan untuk menghitung rata-rata dan deviasi standar untuk berat trotoar kendaraan. mengingat kolom kategoris, num-of-doors.

Tabel berikut mengilustrasikan hasilnya:

Isi Num-of-doors Berat trotoar Mean(curb-weight|num-of-doors) Std-Dev (curb-weight|num-of-doors)
std two 2548 2429.785714 507.45699
std empat 2337 2625.6 493.409877
std two 2507 2429.785714 507.45699
Turbo empat 3086 2625.6 5 493.409877
std empat 1989 2625.6 493.409877
Turbo 2191
std empat 2535 2625.6 493.409877

Anda dapat memverifikasi rata-rata untuk setiap kelompok nilai dengan AVERAGEIF menggunakan fungsi di Excel.

Contoh 3 - Menangani nilai yang hilang

Contoh ini menunjukkan bagaimana nilai yang hilang (null) merambat ke hasil ketika skor probabilitas bersyarat dihitung.

  • Jika kolom nilai diskrit dan kolom pencarian perhitungan berisi nilai yang hilang, nilai yang hilang disebarkan ke kolom baru.

  • Jika kolom nilai diskrit hanya berisi nilai yang hilang, modul tidak dapat memproses kolom dan pesan kesalahan muncul.

X Y P(Y| X)
1 True P(Y=true|X=1) = 1/2
1 FALSE P(Y=false|X=1) = 1/2
2 True P(Y=true|X=2) = 1/3
2 Salah P(Y=false|X=2) = 1/3
2 Null P(Y=null|X=2) = null

Catatan teknis

  • Anda harus memastikan bahwa kolom diskrit apa pun yang ingin Anda ganti bersifat kategoris, atau modul akan mengembalikan kesalahan. Untuk melakukan ini, gunakan modul Edit Metadata .

  • Jika kolom kedua berisi nilai Boolean, nilai True-False diproses sebagai numerik dengan FALSE dan TRUE masing-masing setara dengan 0 dan 1.

  • Rumus untuk kolom deviasi standar menghitung deviasi standar populasi. Oleh karena itu, N digunakan dalam penyebut bukan (N - 1).

  • Jika kolom kedua berisi data nonkategori (nilai numerik atau Boolean), modul menghitung rata-rata dan deviasi standar Y untuk nilai X yang diberikan.

    Artinya, untuk setiap baris dalam himpunan data yang diindeks oleh i:

    Mean(Y│X)i = Mean(Y│X = Xi)

    StdDev(Y│X)i = StdDev(Y│X = Xi)

  • Jika kolom kedua berisi data kategoris atau nilai yang bukan numerik atau Boolean, modul menghitung probabilitas bersyarat Y untuk nilai X yang diberikan.

  • Setiap nilai Boolean di kolom kedua diproses sebagai data numerik dengan FALSE dan TRUE masing-masing setara dengan 0 dan 1.

  • Jika ada kelas di kolom diskrit, sehingga baris dengan nilai yang hilang ada di kolom kedua, jumlah probabilitas bersyarat dalam kelas kurang dari satu.

Input yang diharapkan

Nama Jenis Deskripsi
Himpunan Data Tabel Data Himpunan data input

Parameter modul

Nama Rentang Jenis Default Deskripsi
Kolom diskrit Semua Pilihan Kolom Memilih kolom yang berisi nilai diskrit
Kolom pengganti Semua Pilihan Kolom Memilih kolom yang berisi data untuk digunakan sebagai pengganti nilai diskrit

Output

Nama Jenis Deskripsi
Kumpulan data tambahan Tabel Data Himpunan data dengan data yang diganti
Transform fungsi Antarmuka ITransform Definisi fungsi transformasi, yang dapat diterapkan ke himpunan data lain

Pengecualian

Pengecualian Deskripsi
Kesalahan 0001 Pengecualian terjadi jika satu atau beberapa kolom tertentu dari kumpulan data tidak dapat ditemukan.
Kesalahan 0003 Pengecualian terjadi jika satu atau beberapa input null atau kosong.
Kesalahan 0020 Pengecualian terjadi jika jumlah kolom di beberapa himpunan data yang diteruskan ke modul terlalu kecil.
Kesalahan 0021 Pengecualian terjadi jika jumlah baris di beberapa himpunan data yang diteruskan ke modul terlalu kecil.
Kesalahan 0017 Pengecualian terjadi jika satu atau beberapa kolom tertentu memiliki tipe yang tidak didukung oleh modul saat ini.
Kesalahan 0026 Pengecualian terjadi ketika kolom dengan nama yang sama tidak diizinkan.
Kesalahan 0022 Pengecualian terjadi jika jumlah kolom yang dipilih dalam himpunan data input tidak sama dengan angka yang diharapkan.

Untuk daftar kesalahan khusus untuk modul Studio (klasik), lihat Pembelajaran Mesin Kode kesalahan.

Untuk daftar pengecualian API, lihat Pembelajaran Mesin Kode Kesalahan REST API.

Lihat juga

Fungsi statistik