หมายเหตุ
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลอง ลงชื่อเข้าใช้หรือเปลี่ยนไดเรกทอรีได้
การเข้าถึงหน้านี้ต้องได้รับการอนุญาต คุณสามารถลองเปลี่ยนไดเรกทอรีได้
Data Wrangler เร่งเวิร์กโฟลว์การเตรียมข้อมูลของคุณโดยจัดเตรียมอินเทอร์เฟซภาพที่สมจริงสําหรับการวิเคราะห์ข้อมูลเชิงสํารวจ ในบทความนี้ คุณจะได้เรียนรู้วิธีการ:
- เปิดใช้ Data Wrangler จากสมุดบันทึก Fabric ของคุณ
- สํารวจข้อมูลด้วยการแสดงภาพแบบโต้ตอบและสถิติสรุป
- ใช้การดําเนินการล้างข้อมูลทั่วไปด้วยการสร้างโค้ดอัตโนมัติ
- ส่งออกแพนด้าหรือฟังก์ชัน PySpark ที่นํากลับมาใช้ใหม่ได้กลับไปยังโน้ตบุ๊กของคุณ
บทความนี้มุ่งเน้นไปที่ DataFrames ของแพนด้า สําหรับ Spark DataFrames โปรดดูแหล่งข้อมูลนี้
ข้อกำหนดเบื้องต้น
รับการสมัครใช้งาน Microsoft Fabric หรือลงทะเบียนเพื่อทดลองใช้งาน Microsoft Fabric ฟรี
ลงชื่อเข้าใช้ Microsoft Fabric
สลับไปยัง Fabric โดยใช้ตัวสลับประสบการณ์ที่ด้านซ้ายล่างของโฮมเพจของคุณ
ข้อจำกัด
- การดําเนินการโค้ดแบบกําหนดเองในปัจจุบันรองรับเฉพาะ DataFrames ของแพนด้าเท่านั้น
- จอแสดงผล Data Wrangler ทํางานได้ดีที่สุดบนจอภาพขนาดใหญ่ อย่างไรก็ตาม คุณสามารถย่อหรือซ่อนส่วนต่างๆ ของอินเทอร์เฟซเพื่อรองรับหน้าจอที่เล็กลงได้
เปิดใช้ Data Wrangler
คุณสามารถเปิดใช้ Data Wrangler ได้โดยตรงจากสมุดบันทึก Microsoft Fabric เพื่อสํารวจและแปลงแพนด้าหรือ Spark DataFrame
เมื่อต้องการเริ่มต้นใช้งานข้อมูลตัวอย่าง:
ส่วนย่อยของโค้ดนี้แสดงวิธีการอ่านข้อมูลตัวอย่างลงใน Pandas DataFrame:
import pandas as pd
# Read a CSV into a Pandas DataFrame
df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/titanic.csv")
display(df)
ในแท็บ "หน้าแรก" ของ Ribbon โน้ตบุ๊ก ให้ใช้ดรอปดาวน์ Data Wrangler เพื่อเรียกดู DataFrames ที่ใช้งานอยู่พร้อมสําหรับการแก้ไข เลือกรายการที่คุณต้องการเปิดใน Data Wrangler
เคล็ดลับ
คุณไม่สามารถเปิด Data Wrangler ในขณะที่เคอร์เนลของโน้ตบุ๊กไม่ว่าง เซลล์ที่ดําเนินการต้องเสร็จสิ้นก่อนที่ Data Wrangler จะสามารถเปิดใช้ได้ดังที่แสดงในภาพหน้าจอนี้:
เปิด Data Wrangler จากเซลล์
คุณยังสามารถเปิด Data Wrangler ได้โดยตรงจากเซลล์สมุดบันทึกโดยไม่ต้องไปที่ Ribbon จุดเข้าใช้งานแบบอินไลน์นี้จะแสดง Data Wrangler ในตําแหน่งที่คุณทํางานกับ DataFrames
เมื่อคุณเรียกใช้เซลล์ที่ส่งออก DataFrame พร้อมท์ Data Wrangler จะปรากฏขึ้นที่ระดับเซลล์ เลือกพร้อมท์เพื่อเปิด DataFrame นั้นใน Data Wrangler คําสั่งที่รองรับ ได้แก่ :
-
df.head()หรือdf.head(n) -
df.tail()หรือdf.tail(n) -
df.show()หรือdf.show(n)
เรียกใช้เซลล์ที่ส่งออก DataFrame:
import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/titanic.csv") df.head()หลังจากที่เซลล์ทํางานเสร็จแล้ว พร้อมท์ Data Wrangler จะปรากฏขึ้นที่เซลล์ เลือก เปิดใน Data Wrangler เพื่อเปิดใช้ Data Wrangler ด้วย
dfDataFrame
เมื่อเซลล์กําหนด DataFrames หลายรายการ พร้อมท์จะให้เมนูย่อยที่แสดงรายการ DataFrames ทั้งหมดในเซลล์ คุณสามารถเปิดไฟล์ใดก็ได้ใน Data Wrangler แม้กระทั่งไฟล์ที่คุณไม่ได้พิมพ์อย่างชัดเจน
เรียกใช้เซลล์ที่กําหนด DataFrames หลายรายการ:
import pandas as pd titanic_df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/titanic.csv") iris_df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/iris-data.csv") titanic_df.head() iris_df.head()หลังจากที่เซลล์ทํางานเสร็จแล้ว ให้เลือกพรอมต์ Data Wrangler ที่เซลล์ เมนูย่อยจะแสดงรายการ DataFrames ทั้งหมดที่กําหนดไว้ในเซลล์ เลือกรายการที่คุณต้องการสํารวจ
เคล็ดลับ
เมนูย่อยแสดงรายการ DataFrames ที่กําหนดไว้ในเซลล์ปัจจุบัน เมื่อต้องการเปิด DataFrame จากเซลล์ก่อนหน้า ให้เรียกใช้เซลล์ใหม่ที่อ้างอิงเซลล์นั้น หรือใช้ดรอปดาวน์ Data Wrangler ในแท็บ Ribbon หน้าแรก เพื่อเรียกดู DataFrames ที่ใช้งานอยู่ทั้งหมด
การเลือกตัวอย่างแบบกําหนดเอง
เมื่อต้องการเปิดตัวอย่างแบบกําหนดเองของ DataFrame ที่ใช้งานอยู่ด้วย Data Wrangler ให้เลือก เลือกตัวอย่างแบบกําหนดเอง จากดรอปดาวน์ ดังที่แสดงในภาพหน้าจอนี้:
การดําเนินการนี้จะเปิดกล่องโต้ตอบพร้อมตัวเลือกในการระบุขนาดของตัวอย่างที่ต้องการ (จํานวนแถว) และวิธีการสุ่มตัวอย่าง (ระเบียนแรก ระเบียนสุดท้าย หรือชุดสุ่ม) 5,000 แถวแรกของ DataFrame ทําหน้าที่เป็นขนาดตัวอย่างเริ่มต้น ดังที่แสดงในภาพหน้าจอนี้:
การดูสถิติสรุป
เมื่อโหลด Data Wrangler จะแสดงภาพรวมเชิงพรรณนาของ DataFrame ที่เลือกในแผงสรุป ภาพรวมนี้ประกอบด้วยข้อมูลเกี่ยวกับมิติข้อมูล DataFrame ค่าที่ขาดหายไป และอื่นๆ เมื่อคุณเลือกคอลัมน์ใดๆ ในกริด Data Wrangler แผง สรุป จะอัปเดตเพื่อแสดงสถิติเชิงพรรณนาเกี่ยวกับคอลัมน์เฉพาะนั้น ข้อมูลเชิงลึกด่วนเกี่ยวกับทุกคอลัมน์จะพร้อมใช้งานในส่วนหัวด้วย
เคล็ดลับ
สถิติและวิชวลเฉพาะคอลัมน์ (ทั้งในแผง สรุป และในส่วนหัวของคอลัมน์) ขึ้นอยู่กับชนิดข้อมูลคอลัมน์ ตัวอย่างเช่น ฮิสโทแกรมที่ผูกไว้ของคอลัมน์ตัวเลขจะปรากฏในส่วนหัวของคอลัมน์ก็ต่อเมื่อคอลัมน์ถูกแปลงเป็นชนิดตัวเลขดังที่แสดงในภาพหน้าจอนี้:
การเรียกดูการดําเนินการทําความสะอาดข้อมูล
แผง การดําเนินการ แสดงรายการการดําเนินการล้างข้อมูลที่ค้นหาได้ เมื่อคุณเลือกการดําเนินการล้างข้อมูลจากแผง การดําเนินงาน คุณจําเป็นต้องระบุคอลัมน์เป้าหมายหรือคอลัมน์ พร้อมกับพารามิเตอร์ที่จําเป็นเพื่อให้การดําเนินการเสร็จสมบูรณ์ ตัวอย่างเช่น พร้อมท์ให้ปรับขนาดคอลัมน์ตามตัวเลข จําเป็นต้องมีช่วงของค่าใหม่ ดังที่แสดงในสกรีนช็อตนี้:
เคล็ดลับ
คุณสามารถใช้การดําเนินการที่มีขนาดเล็กกว่าจากเมนูของแต่ละส่วนหัวของคอลัมน์ ดังที่แสดงในภาพหน้าจอนี้:
การแสดงตัวอย่างและการใช้การดําเนินการ
Data Wrangler แสดงเส้นตารางโดยอัตโนมัติแสดงตัวอย่างผลลัพธ์ของการดําเนินการที่เลือก และรหัสที่สอดคล้องกันจะปรากฏในแผงด้านล่างเส้นตารางโดยอัตโนมัติ หากต้องการยอมรับโค้ดที่แสดงตัวอย่าง ให้เลือก นําไปใช้ ในตําแหน่งใดตําแหน่งหนึ่ง หากต้องการลบโค้ดที่แสดงตัวอย่างและลองดําเนินการใหม่ ให้เลือก ละทิ้ง ตามที่แสดงในภาพหน้าจอนี้:
เมื่อคุณใช้การดําเนินการ ตารางแสดง Data Wrangler และสถิติสรุปจะอัปเดตเพื่อแสดงผลลัพธ์ โค้ดจะปรากฏในรายการที่ทํางานอยู่ของการดําเนินการที่ผูกมัดในแผง ขั้นตอนการทําความสะอาด ดังที่แสดงในภาพหน้าจอนี้:
เคล็ดลับ
คุณสามารถยกเลิกขั้นตอนที่ใช้ล่าสุดได้เสมอ ในแผง ขั้นตอนการทําความสะอาด ไอคอนถังขยะจะปรากฏขึ้นเมื่อคุณวางเคอร์เซอร์เหนือขั้นตอนที่ใช้ล่าสุด ดังที่แสดงในภาพหน้าจอนี้
ตารางนี้สรุปการดําเนินการที่ Data Wrangler สนับสนุนในขณะนี้:
| การดำเนินการ | คำอธิบาย: |
|---|---|
| จัดเรียง | เรียงลําดับคอลัมน์จากน้อยไปหามากหรือจากมากไปหาน้อย |
| ตัวกรอง | กรองแถวโดยยึดตามเงื่อนไขอย่างน้อยหนึ่งข้อ |
| เข้ารหัสหนึ่งร้อน | สร้างคอลัมน์ใหม่สําหรับแต่ละค่าที่ไม่ซ้ํากันในคอลัมน์ที่มีอยู่ ที่ระบุการมีอยู่หรือไม่มีค่าเหล่านั้นสําหรับแต่ละแถว |
| ไบนาไรเซอร์หลายฉลาก | แยกข้อมูลโดยใช้ตัวคั่นและสร้างคอลัมน์ใหม่สําหรับแต่ละประเภท โดยทําเครื่องหมาย 1 หากแถวมีประเภทนั้น และ 0 ถ้าไม่มี |
| เปลี่ยนชนิดคอลัมน์ | เปลี่ยนชนิดข้อมูลของคอลัมน์ |
| ปล่อยคอลัมน์ | ลบคอลัมน์อย่างน้อยหนึ่งคอลัมน์ |
| เลือกคอลัมน์ | เลือกหนึ่งหรือหลายคอลัมน์เพื่อเก็บ และลบส่วนที่เหลือ |
| เปลี่ยนชื่อคอลัมน์ | เปลี่ยนชื่อคอลัมน์ |
| ปล่อยค่าที่หายไป | ลบแถวที่มีค่าที่ขาดหายไป |
| ทิ้งแถวที่ซ้ํากัน | วางแถวทั้งหมดที่มีค่าที่ซ้ํากันในหนึ่งคอลัมน์หรือมากกว่า |
| เติมค่าที่หายไป | แทนที่เซลล์ด้วยค่าที่หายไปด้วยค่าใหม่ |
| ค้นหาและแทนที่ | แทนที่เซลล์ด้วยรูปแบบที่ตรงกัน |
| จัดกลุ่มตามคอลัมน์และรวม | จัดกลุ่มตามค่าคอลัมน์และรวมผลลัพธ์ |
| แถบช่องว่าง | เอาช่องว่างออกจากส่วนเริ่มต้นและส่วนท้ายของข้อความ |
| แยกข้อความ | แยกคอลัมน์ออกเป็นหลายคอลัมน์โดยยึดตามตัวคั่นที่ผู้ใช้กําหนดเอง |
| แปลงข้อความเป็นตัวพิมพ์เล็ก | แปลงข้อความเป็นตัวพิมพ์เล็ก |
| แปลงข้อความเป็นตัวพิมพ์ใหญ่ | แปลงข้อความเป็นตัวพิมพ์ใหญ่ |
| ค่าต่ําสุด/สูงสุดของสเกล | ปรับมาตราส่วนคอลัมน์ตัวเลขระหว่างค่าต่ําสุดและสูงสุด |
| การเติมแฟลช | สร้างคอลัมน์ใหม่โดยอัตโนมัติตามตัวอย่างที่สืบทอดมาจากคอลัมน์ที่มีอยู่ |
ปรับแต่งจอแสดงผลของคุณ
คุณสามารถปรับแต่งอินเทอร์เฟซได้ตลอดเวลาโดยใช้แท็บ "มุมมอง" ในแถบเครื่องมือเหนือตารางแสดง Data Wrangler ตัวเลือกนี้สามารถซ่อนหรือแสดงบานหน้าต่างต่างๆ ตามการตั้งค่าและขนาดหน้าจอของคุณ ดังที่แสดงในภาพหน้าจอนี้:
การบันทึกและการส่งออกรหัส
แถบเครื่องมือด้านบนเส้นตารางการแสดงผล Data Wrangler มีตัวเลือกในการบันทึกรหัสที่สร้างขึ้น คุณสามารถคัดลอกรหัสไปยังคลิปบอร์ดหรือส่งออกไปยังสมุดบันทึกเป็นฟังก์ชัน การส่งออกโค้ดจะปิด Data Wrangler และเพิ่มฟังก์ชันใหม่ไปยังเซลล์โค้ดในสมุดบันทึก คุณยังสามารถดาวน์โหลด DataFrame ที่ทําความสะอาดแล้วเป็นไฟล์ CSV ได้อีกด้วย
เคล็ดลับ
Data Wrangler สร้างโค้ดที่ทํางานเฉพาะเมื่อคุณเรียกใช้เซลล์ใหม่ด้วยตนเอง และจะไม่เขียนทับ DataFrame เดิมของคุณ ดังที่แสดงในภาพหน้าจอนี้:
จากนั้นคุณสามารถเรียกใช้โค้ดที่ส่งออกตามที่แสดงในภาพหน้าจอนี้:
ขั้นตอนถัดไป
เมื่อคุณทราบวิธีใช้ Data Wrangler กับ DataFrames ของแพนด้าแล้ว ให้สํารวจแหล่งข้อมูลเหล่านี้:
- ใช้ Data Wrangler กับ Spark DataFrames - ใช้เทคนิคเดียวกันกับ Spark DataFrames
- ดูการสาธิตสด - ดูการทํางานของ Data Wrangler กับ Guy in a Cube
- ลองใช้ Data Wrangler ใน VS Code - ใช้ Data Wrangler ใน Visual Studio Code
มีข้อเสนอแนะ? แบ่งปันความคิดของคุณในฟอรั่มไอเดียผ้า