เร่งการเตรียมข้อมูลด้วย Data Wrangler ใน Microsoft Fabric

Data Wrangler เร่งเวิร์กโฟลว์การเตรียมข้อมูลของคุณโดยจัดเตรียมอินเทอร์เฟซภาพที่สมจริงสําหรับการวิเคราะห์ข้อมูลเชิงสํารวจ ในบทความนี้ คุณจะได้เรียนรู้วิธีการ:

  • เปิดใช้ Data Wrangler จากสมุดบันทึก Fabric ของคุณ
  • สํารวจข้อมูลด้วยการแสดงภาพแบบโต้ตอบและสถิติสรุป
  • ใช้การดําเนินการล้างข้อมูลทั่วไปด้วยการสร้างโค้ดอัตโนมัติ
  • ส่งออกแพนด้าหรือฟังก์ชัน PySpark ที่นํากลับมาใช้ใหม่ได้กลับไปยังโน้ตบุ๊กของคุณ

บทความนี้มุ่งเน้นไปที่ DataFrames ของแพนด้า สําหรับ Spark DataFrames โปรดดูแหล่งข้อมูลนี้

ข้อกำหนดเบื้องต้น

ข้อจำกัด

  • การดําเนินการโค้ดแบบกําหนดเองในปัจจุบันรองรับเฉพาะ DataFrames ของแพนด้าเท่านั้น
  • จอแสดงผล Data Wrangler ทํางานได้ดีที่สุดบนจอภาพขนาดใหญ่ อย่างไรก็ตาม คุณสามารถย่อหรือซ่อนส่วนต่างๆ ของอินเทอร์เฟซเพื่อรองรับหน้าจอที่เล็กลงได้

เปิดใช้ Data Wrangler

คุณสามารถเปิดใช้ Data Wrangler ได้โดยตรงจากสมุดบันทึก Microsoft Fabric เพื่อสํารวจและแปลงแพนด้าหรือ Spark DataFrame

เมื่อต้องการเริ่มต้นใช้งานข้อมูลตัวอย่าง:

ส่วนย่อยของโค้ดนี้แสดงวิธีการอ่านข้อมูลตัวอย่างลงใน Pandas DataFrame:

import pandas as pd

# Read a CSV into a Pandas DataFrame
df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/titanic.csv")
display(df)

ในแท็บ "หน้าแรก" ของ Ribbon โน้ตบุ๊ก ให้ใช้ดรอปดาวน์ Data Wrangler เพื่อเรียกดู DataFrames ที่ใช้งานอยู่พร้อมสําหรับการแก้ไข เลือกรายการที่คุณต้องการเปิดใน Data Wrangler

เคล็ดลับ

คุณไม่สามารถเปิด Data Wrangler ในขณะที่เคอร์เนลของโน้ตบุ๊กไม่ว่าง เซลล์ที่ดําเนินการต้องเสร็จสิ้นก่อนที่ Data Wrangler จะสามารถเปิดใช้ได้ดังที่แสดงในภาพหน้าจอนี้:

สกรีนช็อตแสดงสมุดบันทึก Fabric ที่มีพร้อมท์ดรอปดาวน์ Data Wrangler

เปิด Data Wrangler จากเซลล์

คุณยังสามารถเปิด Data Wrangler ได้โดยตรงจากเซลล์สมุดบันทึกโดยไม่ต้องไปที่ Ribbon จุดเข้าใช้งานแบบอินไลน์นี้จะแสดง Data Wrangler ในตําแหน่งที่คุณทํางานกับ DataFrames

เมื่อคุณเรียกใช้เซลล์ที่ส่งออก DataFrame พร้อมท์ Data Wrangler จะปรากฏขึ้นที่ระดับเซลล์ เลือกพร้อมท์เพื่อเปิด DataFrame นั้นใน Data Wrangler คําสั่งที่รองรับ ได้แก่ :

  • df.head() หรือ df.head(n)
  • df.tail() หรือ df.tail(n)
  • df.show() หรือ df.show(n)
  1. เรียกใช้เซลล์ที่ส่งออก DataFrame:

    import pandas as pd
    
    df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/titanic.csv")
    df.head()
    
  2. หลังจากที่เซลล์ทํางานเสร็จแล้ว พร้อมท์ Data Wrangler จะปรากฏขึ้นที่เซลล์ เลือก เปิดใน Data Wrangler เพื่อเปิดใช้ Data Wrangler ด้วย df DataFrame

    สกรีนช็อตแสดงพร้อมท์ Data Wrangler ที่ระดับเซลล์สําหรับ DataFrame เดียว

เมื่อเซลล์กําหนด DataFrames หลายรายการ พร้อมท์จะให้เมนูย่อยที่แสดงรายการ DataFrames ทั้งหมดในเซลล์ คุณสามารถเปิดไฟล์ใดก็ได้ใน Data Wrangler แม้กระทั่งไฟล์ที่คุณไม่ได้พิมพ์อย่างชัดเจน

  1. เรียกใช้เซลล์ที่กําหนด DataFrames หลายรายการ:

    import pandas as pd
    
    titanic_df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/titanic.csv")
    iris_df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/iris-data.csv")
    titanic_df.head()
    iris_df.head()
    
  2. หลังจากที่เซลล์ทํางานเสร็จแล้ว ให้เลือกพรอมต์ Data Wrangler ที่เซลล์ เมนูย่อยจะแสดงรายการ DataFrames ทั้งหมดที่กําหนดไว้ในเซลล์ เลือกรายการที่คุณต้องการสํารวจ

    สกรีนช็อตแสดงเมนูย่อย Data Wrangler ที่ระดับเซลล์ที่แสดงรายการ DataFrames หลายรายการ

เคล็ดลับ

เมนูย่อยแสดงรายการ DataFrames ที่กําหนดไว้ในเซลล์ปัจจุบัน เมื่อต้องการเปิด DataFrame จากเซลล์ก่อนหน้า ให้เรียกใช้เซลล์ใหม่ที่อ้างอิงเซลล์นั้น หรือใช้ดรอปดาวน์ Data Wrangler ในแท็บ Ribbon หน้าแรก เพื่อเรียกดู DataFrames ที่ใช้งานอยู่ทั้งหมด

การเลือกตัวอย่างแบบกําหนดเอง

เมื่อต้องการเปิดตัวอย่างแบบกําหนดเองของ DataFrame ที่ใช้งานอยู่ด้วย Data Wrangler ให้เลือก เลือกตัวอย่างแบบกําหนดเอง จากดรอปดาวน์ ดังที่แสดงในภาพหน้าจอนี้:

ภาพหน้าจอแสดงข้อความแจ้งแบบเลื่อนลง Data Wrangler พร้อมตัวเลือกตัวอย่างที่ระบุไว้

การดําเนินการนี้จะเปิดกล่องโต้ตอบพร้อมตัวเลือกในการระบุขนาดของตัวอย่างที่ต้องการ (จํานวนแถว) และวิธีการสุ่มตัวอย่าง (ระเบียนแรก ระเบียนสุดท้าย หรือชุดสุ่ม) 5,000 แถวแรกของ DataFrame ทําหน้าที่เป็นขนาดตัวอย่างเริ่มต้น ดังที่แสดงในภาพหน้าจอนี้:

สกรีนช็อตที่แสดงพร้อมท์ตัวอย่างแบบกําหนดเองของ Data Wrangler

การดูสถิติสรุป

เมื่อโหลด Data Wrangler จะแสดงภาพรวมเชิงพรรณนาของ DataFrame ที่เลือกในแผงสรุป ภาพรวมนี้ประกอบด้วยข้อมูลเกี่ยวกับมิติข้อมูล DataFrame ค่าที่ขาดหายไป และอื่นๆ เมื่อคุณเลือกคอลัมน์ใดๆ ในกริด Data Wrangler แผง สรุป จะอัปเดตเพื่อแสดงสถิติเชิงพรรณนาเกี่ยวกับคอลัมน์เฉพาะนั้น ข้อมูลเชิงลึกด่วนเกี่ยวกับทุกคอลัมน์จะพร้อมใช้งานในส่วนหัวด้วย

เคล็ดลับ

สถิติและวิชวลเฉพาะคอลัมน์ (ทั้งในแผง สรุป และในส่วนหัวของคอลัมน์) ขึ้นอยู่กับชนิดข้อมูลคอลัมน์ ตัวอย่างเช่น ฮิสโทแกรมที่ผูกไว้ของคอลัมน์ตัวเลขจะปรากฏในส่วนหัวของคอลัมน์ก็ต่อเมื่อคอลัมน์ถูกแปลงเป็นชนิดตัวเลขดังที่แสดงในภาพหน้าจอนี้:

สกรีนช็อตที่แสดงบานหน้าต่างแสดงเส้นตารางและสรุปของ Data Wrangler

การเรียกดูการดําเนินการทําความสะอาดข้อมูล

แผง การดําเนินการ แสดงรายการการดําเนินการล้างข้อมูลที่ค้นหาได้ เมื่อคุณเลือกการดําเนินการล้างข้อมูลจากแผง การดําเนินงาน คุณจําเป็นต้องระบุคอลัมน์เป้าหมายหรือคอลัมน์ พร้อมกับพารามิเตอร์ที่จําเป็นเพื่อให้การดําเนินการเสร็จสมบูรณ์ ตัวอย่างเช่น พร้อมท์ให้ปรับขนาดคอลัมน์ตามตัวเลข จําเป็นต้องมีช่วงของค่าใหม่ ดังที่แสดงในสกรีนช็อตนี้:

สกรีนช็อตที่แสดงแผงการดําเนินงาน Data Wrangler

เคล็ดลับ

คุณสามารถใช้การดําเนินการที่มีขนาดเล็กกว่าจากเมนูของแต่ละส่วนหัวของคอลัมน์ ดังที่แสดงในภาพหน้าจอนี้:

สกรีนช็อตแสดงการดําเนินการ Data Wrangler ที่สามารถนําไปใช้จากเมนูส่วนหัวของคอลัมน์ได้

การแสดงตัวอย่างและการใช้การดําเนินการ

Data Wrangler แสดงเส้นตารางโดยอัตโนมัติแสดงตัวอย่างผลลัพธ์ของการดําเนินการที่เลือก และรหัสที่สอดคล้องกันจะปรากฏในแผงด้านล่างเส้นตารางโดยอัตโนมัติ หากต้องการยอมรับโค้ดที่แสดงตัวอย่าง ให้เลือก นําไปใช้ ในตําแหน่งใดตําแหน่งหนึ่ง หากต้องการลบโค้ดที่แสดงตัวอย่างและลองดําเนินการใหม่ ให้เลือก ละทิ้ง ตามที่แสดงในภาพหน้าจอนี้:

สกรีนช็อตที่แสดงการดําเนินการของ Data Wrangler ที่กําลังดําเนินการ

เมื่อคุณใช้การดําเนินการ ตารางแสดง Data Wrangler และสถิติสรุปจะอัปเดตเพื่อแสดงผลลัพธ์ โค้ดจะปรากฏในรายการที่ทํางานอยู่ของการดําเนินการที่ผูกมัดในแผง ขั้นตอนการทําความสะอาด ดังที่แสดงในภาพหน้าจอนี้:

สกรีนช็อตที่แสดงการดําเนินการของ Data Wrangler ที่ใช้

เคล็ดลับ

คุณสามารถยกเลิกขั้นตอนที่ใช้ล่าสุดได้เสมอ ในแผง ขั้นตอนการทําความสะอาด ไอคอนถังขยะจะปรากฏขึ้นเมื่อคุณวางเคอร์เซอร์เหนือขั้นตอนที่ใช้ล่าสุด ดังที่แสดงในภาพหน้าจอนี้

สกรีนช็อตที่แสดงการดําเนินการ Data Wrangler ที่สามารถยกเลิกได้

ตารางนี้สรุปการดําเนินการที่ Data Wrangler สนับสนุนในขณะนี้:

การดำเนินการ คำอธิบาย:
จัดเรียง เรียงลําดับคอลัมน์จากน้อยไปหามากหรือจากมากไปหาน้อย
ตัวกรอง กรองแถวโดยยึดตามเงื่อนไขอย่างน้อยหนึ่งข้อ
เข้ารหัสหนึ่งร้อน สร้างคอลัมน์ใหม่สําหรับแต่ละค่าที่ไม่ซ้ํากันในคอลัมน์ที่มีอยู่ ที่ระบุการมีอยู่หรือไม่มีค่าเหล่านั้นสําหรับแต่ละแถว
ไบนาไรเซอร์หลายฉลาก แยกข้อมูลโดยใช้ตัวคั่นและสร้างคอลัมน์ใหม่สําหรับแต่ละประเภท โดยทําเครื่องหมาย 1 หากแถวมีประเภทนั้น และ 0 ถ้าไม่มี
เปลี่ยนชนิดคอลัมน์ เปลี่ยนชนิดข้อมูลของคอลัมน์
ปล่อยคอลัมน์ ลบคอลัมน์อย่างน้อยหนึ่งคอลัมน์
เลือกคอลัมน์ เลือกหนึ่งหรือหลายคอลัมน์เพื่อเก็บ และลบส่วนที่เหลือ
เปลี่ยนชื่อคอลัมน์ เปลี่ยนชื่อคอลัมน์
ปล่อยค่าที่หายไป ลบแถวที่มีค่าที่ขาดหายไป
ทิ้งแถวที่ซ้ํากัน วางแถวทั้งหมดที่มีค่าที่ซ้ํากันในหนึ่งคอลัมน์หรือมากกว่า
เติมค่าที่หายไป แทนที่เซลล์ด้วยค่าที่หายไปด้วยค่าใหม่
ค้นหาและแทนที่ แทนที่เซลล์ด้วยรูปแบบที่ตรงกัน
จัดกลุ่มตามคอลัมน์และรวม จัดกลุ่มตามค่าคอลัมน์และรวมผลลัพธ์
แถบช่องว่าง เอาช่องว่างออกจากส่วนเริ่มต้นและส่วนท้ายของข้อความ
แยกข้อความ แยกคอลัมน์ออกเป็นหลายคอลัมน์โดยยึดตามตัวคั่นที่ผู้ใช้กําหนดเอง
แปลงข้อความเป็นตัวพิมพ์เล็ก แปลงข้อความเป็นตัวพิมพ์เล็ก
แปลงข้อความเป็นตัวพิมพ์ใหญ่ แปลงข้อความเป็นตัวพิมพ์ใหญ่
ค่าต่ําสุด/สูงสุดของสเกล ปรับมาตราส่วนคอลัมน์ตัวเลขระหว่างค่าต่ําสุดและสูงสุด
การเติมแฟลช สร้างคอลัมน์ใหม่โดยอัตโนมัติตามตัวอย่างที่สืบทอดมาจากคอลัมน์ที่มีอยู่

ปรับแต่งจอแสดงผลของคุณ

คุณสามารถปรับแต่งอินเทอร์เฟซได้ตลอดเวลาโดยใช้แท็บ "มุมมอง" ในแถบเครื่องมือเหนือตารางแสดง Data Wrangler ตัวเลือกนี้สามารถซ่อนหรือแสดงบานหน้าต่างต่างๆ ตามการตั้งค่าและขนาดหน้าจอของคุณ ดังที่แสดงในภาพหน้าจอนี้:

สกรีนช็อตที่แสดงเมนู Data Wrangler สําหรับการกําหนดมุมมองการแสดงผล

การบันทึกและการส่งออกรหัส

แถบเครื่องมือด้านบนเส้นตารางการแสดงผล Data Wrangler มีตัวเลือกในการบันทึกรหัสที่สร้างขึ้น คุณสามารถคัดลอกรหัสไปยังคลิปบอร์ดหรือส่งออกไปยังสมุดบันทึกเป็นฟังก์ชัน การส่งออกโค้ดจะปิด Data Wrangler และเพิ่มฟังก์ชันใหม่ไปยังเซลล์โค้ดในสมุดบันทึก คุณยังสามารถดาวน์โหลด DataFrame ที่ทําความสะอาดแล้วเป็นไฟล์ CSV ได้อีกด้วย

เคล็ดลับ

Data Wrangler สร้างโค้ดที่ทํางานเฉพาะเมื่อคุณเรียกใช้เซลล์ใหม่ด้วยตนเอง และจะไม่เขียนทับ DataFrame เดิมของคุณ ดังที่แสดงในภาพหน้าจอนี้:

สกรีนช็อตแสดงตัวเลือกในการส่งออกรหัสใน Data Wrangler

จากนั้นคุณสามารถเรียกใช้โค้ดที่ส่งออกตามที่แสดงในภาพหน้าจอนี้:

สกรีนช็อตแสดงรหัสที่สร้างขึ้นโดย Data Wrangler กลับในสมุดบันทึก

ขั้นตอนถัดไป

เมื่อคุณทราบวิธีใช้ Data Wrangler กับ DataFrames ของแพนด้าแล้ว ให้สํารวจแหล่งข้อมูลเหล่านี้:

มีข้อเสนอแนะ? แบ่งปันความคิดของคุณในฟอรั่มไอเดียผ้า