Catatan
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba masuk atau mengubah direktori.
Akses ke halaman ini memerlukan otorisasi. Anda dapat mencoba mengubah direktori.
Penting
Dukungan untuk Studio Azure Machine Learning (klasik) akan berakhir pada 31 Agustus 2024. Sebaiknya Anda transisi ke Azure Machine Learning sebelum tanggal tersebut.
Mulai 1 Desember 2021, Anda tidak akan dapat membuat sumber daya Studio Azure Machine Learning (klasik) baru. Hingga 31 Agustus 2024, Anda dapat terus menggunakan sumber daya Pembelajaran Mesin Studio (klasik) yang ada.
- Lihat informasi tentang memindahkan proyek pembelajaran mesin dari ML Studio (klasik) ke Azure Machine Learning.
- Mer informasjon tentang Azure Machine Learning.
ML Dokumentasi Studio (klasik) sedang berhenti dan mungkin tidak diperbarui di masa mendatang.
Mengganti nilai diskrit dari satu kolom dengan nilai numerik berdasarkan kolom lain
Kategori: Fungsi Statistik
Catatan
Berlaku untuk: Pembelajaran Mesin Studio (klasik) saja
Modul drag-and-drop serupa tersedia di Azure Machine Learning desainer.
Ringkasan Modul
Artikel ini menjelaskan cara menggunakan modul Ganti Nilai Diskrit di Pembelajaran Mesin Studio (klasik), untuk menghasilkan skor probabilitas yang dapat digunakan untuk mewakili nilai diskrit. Skor ini dapat berguna untuk memahami nilai informasi dari nilai diskrit.
Cara kerjanya:
Anda memilih kolom yang berisi nilai diskrit (atau kategoris), lalu pilih kolom lain untuk digunakan untuk referensi.
Bergantung pada apakah kolom kedua bersifat kategoris atau non-kategoris, modul menghitung salah satu nilai berikut:
- Probabilitas bersyarat untuk kolom kedua diberikan nilai di kolom pertama.
- Deviasi rata-rata dan standar untuk setiap kelompok nilai di kolom pertama.
Modul ini mengeluarkan himpunan data dengan skor, dan fungsi yang dapat Anda simpan dan terapkan ke himpunan data lain.
Cara mengkonfigurasi Ganti Nilai Diskrit
Tip
Sebaiknya bekerja hanya dengan satu pasang kolom sekaligus. Modul tidak menimbulkan kesalahan jika Anda memilih beberapa kolom untuk dianalisis. Namun, dalam praktiknya, jika Anda memilih beberapa kolom, mereka dicocokkan dengan heuristik internal, bukan berdasarkan urutan seleksi.
Oleh karena itu, kami sarankan Anda memilih satu pasang kolom setiap kali, satu untuk kolom Diskrit dan satu untuk kolom Penggantian.
Jika Anda perlu menghasilkan skor untuk beberapa kolom, gunakan instans terpisah dari Ganti Nilai Diskrit.
Tambahkan modul Ganti Nilai Diskrit ke eksperimen Anda. Anda dapat menemukan modul ini di grup Fungsi Statistik dalam daftar item eksperimen di Pembelajaran Mesin Studio (klasik).
Koneksi himpunan data yang berisi setidaknya satu kolom data kategoris.
Kolom diskrit: Klik Pemilih kolom Peluncuran untuk memilih kolom yang berisi nilai diskrit (atau kategoris).
Setiap kolom diskrit yang Anda pilih harus kategoris. Jika Anda mengalami kesalahan, gunakan modul Edit Metadata untuk mengubah tipe kolom.
Kolom pengganti: Klik Pemilih kolom peluncuran untuk memilih kolom yang berisi nilai yang akan digunakan dalam menghitung skor pengganti.
Jika Anda memilih beberapa kolom untuk kolom Diskrit, Anda harus memilih jumlah kolom pengganti yang sama.
Jalankan eksperimen.
Catatan
Anda tidak dapat memilih fungsi statistik mana yang akan diterapkan. Modul menghitung ukuran yang sesuai, berdasarkan tipe data kolom yang dipilih untuk kolom Penggantian.
Hasil
Modul menghitung salah satu nilai berikut untuk setiap pasangan kolom:
Jika kolom kedua berisi nilai kategoris, modul menghitung probabilitas bersyarat kolom kedua, mengingat nilai di kolom pertama.
Misalnya, asumsikan Anda memilih
occupationdari himpunan data Sensus sebagai kolom diskrit dan pilihgendersebagai kolom pengganti. Output dari modul akan menjadi:P(gender | occupation)Jika kolom kedua berisi nilai non-kategoris yang dapat dikonversi menjadi angka (seperti nilai numerik atau Boolean yang tidak ditandai sebagai kategoris), modul mengeluarkan rata-rata dan deviasi standar untuk setiap kelompok nilai di kolom pertama.
Misalnya, asumsikan Anda menggunakan
occupationsebagai kolom Diskrit dan kolom lainnya adalah kolomhours-per-weeknumerik . Modul akan mengeluarkan nilai-nilai baru ini:Mean(hours-per-week | occupation)Std-Dev(hours-per-week | occupation)
Selain skor probabilitas, modul juga menghasilkan dataset yang diubah. Dalam himpunan data ini, kolom yang dipilih sebagai kolom Penggantian diganti dengan kolom yang berisi skor yang dihitung.
Tip
Kolom dalam himpunan data sumber tidak benar-benar diubah atau dihapus oleh operasi; kolom skor adalah kolom baru yang dihasilkan oleh modul dan output, bukan data sumber.
Untuk melihat nilai sumber bersama dengan skor probabilitas, gunakan modul Tambahkan Kolom .
Contoh
Penggunaan Ganti Nilai Diskrit dapat diilustrasikan dengan beberapa contoh sederhana.
Contoh 1 - Ganti nilai kategoris dengan skor probabilitas
Tabel berikut berisi kolom kategoris X, dan kolom Y dengan nilai True/False yang diperlakukan sebagai nilai kategoris. Saat Anda menggunakan Ganti Nilai Diskrit, itu menghitung skor probabilitas bersyarat untuk probabilitas Y yang diberikan X, seperti yang ditunjukkan pada kolom ketiga.
| X | Y | P(Y| X) |
|---|---|---|
| Biru | 0 | P(Y=0|X=Blue) = 0.5 |
| Biru | 1 | P(Y=1|X=Blue) = 0.5 |
| Hijau | 0 | P(Y=0|X=Green) = 2/3 |
| Hijau | 0 | P(Y=0|X=Green) = 2/3 |
| Hijau | 1 | P(Y=1|X=Green) = 1/3 |
| Merah | 0 | P(Y=0|X=Red) = .75 |
| Merah | 0 | P(Y=0|X=Red) = .75 |
| Merah | 1 | P(Y=1|X=Red) = .25 |
| Merah | 0 | P(Y=0|X=Red) = .75 |
Contoh 2 - Hitung rata-rata dan deviasi standar berdasarkan kolom nonkategoris
Ketika kolom kedua numerik, Ganti Nilai Diskrit menghitung rata-rata dan deviasi standar alih-alih skor probabilitas bersyarat.
Contoh berikut didasarkan pada himpunan data sampel Harga Otomatis , disederhanakan sebagai berikut:
Sebagian kecil kolom dipilih.
Hanya 30 baris teratas yang diekstraksi, dengan menggunakan opsi Kepala modul Partisi dan Sampel .
Modul Ganti Nilai Diskrit digunakan untuk menghitung rata-rata dan deviasi standar untuk berat trotoar kendaraan. mengingat kolom kategoris,
num-of-doors.
Tabel berikut mengilustrasikan hasilnya:
| Isi | Num-of-doors | Berat trotoar | Mean(curb-weight|num-of-doors) | Std-Dev (curb-weight|num-of-doors) |
|---|---|---|---|---|
| std | two | 2548 | 2429.785714 | 507.45699 |
| std | empat | 2337 | 2625.6 | 493.409877 |
| std | two | 2507 | 2429.785714 | 507.45699 |
| Turbo | empat | 3086 | 2625.6 5 | 493.409877 |
| std | empat | 1989 | 2625.6 | 493.409877 |
| Turbo | 2191 | |||
| std | empat | 2535 | 2625.6 | 493.409877 |
Anda dapat memverifikasi rata-rata untuk setiap kelompok nilai dengan AVERAGEIF menggunakan fungsi di Excel.
Contoh 3 - Menangani nilai yang hilang
Contoh ini menunjukkan bagaimana nilai yang hilang (null) merambat ke hasil ketika skor probabilitas bersyarat dihitung.
Jika kolom nilai diskrit dan kolom pencarian perhitungan berisi nilai yang hilang, nilai yang hilang disebarkan ke kolom baru.
Jika kolom nilai diskrit hanya berisi nilai yang hilang, modul tidak dapat memproses kolom dan pesan kesalahan muncul.
| X | Y | P(Y| X) |
|---|---|---|
| 1 | True | P(Y=true|X=1) = 1/2 |
| 1 | FALSE | P(Y=false|X=1) = 1/2 |
| 2 | True | P(Y=true|X=2) = 1/3 |
| 2 | Salah | P(Y=false|X=2) = 1/3 |
| 2 | Null | P(Y=null|X=2) = null |
Catatan teknis
Anda harus memastikan bahwa kolom diskrit apa pun yang ingin Anda ganti bersifat kategoris, atau modul akan mengembalikan kesalahan. Untuk melakukan ini, gunakan modul Edit Metadata .
Jika kolom kedua berisi nilai Boolean, nilai True-False diproses sebagai numerik dengan FALSE dan TRUE masing-masing setara dengan 0 dan 1.
Rumus untuk kolom deviasi standar menghitung deviasi standar populasi. Oleh karena itu, N digunakan dalam penyebut bukan (N - 1).
Jika kolom kedua berisi data nonkategori (nilai numerik atau Boolean), modul menghitung rata-rata dan deviasi standar Y untuk nilai X yang diberikan.
Artinya, untuk setiap baris dalam himpunan data yang diindeks oleh
i:Mean(Y│X)i = Mean(Y│X = Xi)StdDev(Y│X)i = StdDev(Y│X = Xi)Jika kolom kedua berisi data kategoris atau nilai yang bukan numerik atau Boolean, modul menghitung probabilitas bersyarat Y untuk nilai X yang diberikan.
Setiap nilai Boolean di kolom kedua diproses sebagai data numerik dengan FALSE dan TRUE masing-masing setara dengan 0 dan 1.
Jika ada kelas di kolom diskrit, sehingga baris dengan nilai yang hilang ada di kolom kedua, jumlah probabilitas bersyarat dalam kelas kurang dari satu.
Input yang diharapkan
| Nama | Jenis | Deskripsi |
|---|---|---|
| Himpunan Data | Tabel Data | Himpunan data input |
Parameter modul
| Nama | Rentang | Jenis | Default | Deskripsi |
|---|---|---|---|---|
| Kolom diskrit | Semua | Pilihan Kolom | Memilih kolom yang berisi nilai diskrit | |
| Kolom pengganti | Semua | Pilihan Kolom | Memilih kolom yang berisi data untuk digunakan sebagai pengganti nilai diskrit |
Output
| Nama | Jenis | Deskripsi |
|---|---|---|
| Kumpulan data tambahan | Tabel Data | Himpunan data dengan data yang diganti |
| Transform fungsi | Antarmuka ITransform | Definisi fungsi transformasi, yang dapat diterapkan ke himpunan data lain |
Pengecualian
| Pengecualian | Deskripsi |
|---|---|
| Kesalahan 0001 | Pengecualian terjadi jika satu atau beberapa kolom tertentu dari kumpulan data tidak dapat ditemukan. |
| Kesalahan 0003 | Pengecualian terjadi jika satu atau beberapa input null atau kosong. |
| Kesalahan 0020 | Pengecualian terjadi jika jumlah kolom di beberapa himpunan data yang diteruskan ke modul terlalu kecil. |
| Kesalahan 0021 | Pengecualian terjadi jika jumlah baris di beberapa himpunan data yang diteruskan ke modul terlalu kecil. |
| Kesalahan 0017 | Pengecualian terjadi jika satu atau beberapa kolom tertentu memiliki tipe yang tidak didukung oleh modul saat ini. |
| Kesalahan 0026 | Pengecualian terjadi ketika kolom dengan nama yang sama tidak diizinkan. |
| Kesalahan 0022 | Pengecualian terjadi jika jumlah kolom yang dipilih dalam himpunan data input tidak sama dengan angka yang diharapkan. |
Untuk daftar kesalahan khusus untuk modul Studio (klasik), lihat Pembelajaran Mesin Kode kesalahan.
Untuk daftar pengecualian API, lihat Pembelajaran Mesin Kode Kesalahan REST API.