Σημείωμα
Η πρόσβαση σε αυτήν τη σελίδα απαιτεί εξουσιοδότηση. Μπορείτε να δοκιμάσετε να εισέλθετε ή να αλλάξετε καταλόγους.
Η πρόσβαση σε αυτήν τη σελίδα απαιτεί εξουσιοδότηση. Μπορείτε να δοκιμάσετε να αλλάξετε καταλόγους.
Το Data Wrangler επιταχύνει τη ροή εργασιών προετοιμασίας δεδομένων παρέχοντας μια καθηλωτική, οπτική διεπαφή για διερευνητική ανάλυση δεδομένων. Σε αυτό το άρθρο, θα μάθετε πώς μπορείτε να κάνετε τα εξής:
- Εκκινήστε το Data Wrangler από το σημειωματάριό σας Fabric
- Εξερευνήστε δεδομένα με διαδραστικές απεικονίσεις και συνοπτικά στατιστικά στοιχεία
- Εφαρμογή κοινών λειτουργιών καθαρισμού δεδομένων με αυτόματη δημιουργία κώδικα
- Εξαγωγή επαναχρησιμοποιήσιμων panda ή λειτουργιών PySpark πίσω στο φορητό υπολογιστή σας
Αυτό το άρθρο εστιάζει στα pandas DataFrames. Για το Spark DataFrames, ανατρέξτε σε αυτόν τον πόρο.
Προαπαιτούμενα στοιχεία
Λάβετε μια συνδρομή Microsoft Fabric. Εναλλακτικά, εγγραφείτε για μια δωρεάν δοκιμαστική έκδοση του Microsoft Fabric.
Εισέλθετε στο Microsoft Fabric.
Μεταβείτε στο Fabric χρησιμοποιώντας την εναλλαγή εμπειριών στην κάτω αριστερή πλευρά της αρχικής σελίδας σας.
Περιορισμοί
- Οι λειτουργίες προσαρμοσμένου κώδικα υποστηρίζουν προς το παρόν μόνο pandas DataFrames.
- Η οθόνη Data Wrangler λειτουργεί καλύτερα σε μεγάλες οθόνες. Ωστόσο, μπορείτε να ελαχιστοποιήσετε ή να αποκρύψετε διαφορετικά τμήματα της διεπαφής για να φιλοξενήσετε μικρότερες οθόνες.
Εκκίνηση του Data Wrangler
Μπορείτε να εκκινήσετε το Data Wrangler απευθείας από ένα σημειωματάριο Microsoft Fabric για να εξερευνήσετε και να μεταμορφώσετε τυχόν panda ή Spark DataFrame.
Για να ξεκινήσετε με το δείγμα δεδομένων:
Αυτό το τμήμα κώδικα εμφανίζει τον τρόπο ανάγνωσης δείγματος δεδομένων σε ένα dataFrame pandas:
import pandas as pd
# Read a CSV into a Pandas DataFrame
df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/titanic.csv")
display(df)
Στην καρτέλα "Αρχική σελίδα" της κορδέλας σημειωματαρίου, χρησιμοποιήστε το αναπτυσσόμενο μενού Data Wrangler για να περιηγηθείτε στα ενεργά DataFrames που είναι διαθέσιμα για επεξεργασία. Επιλέξτε αυτό που θέλετε να ανοίξετε στο Data Wrangler.
Φιλοδώρημα
Δεν μπορείτε να ανοίξετε το Data Wrangler ενώ ο πυρήνας του σημειωματάριου είναι απασχολημένος. Ένα κελί εκτέλεσης πρέπει να ολοκληρωθεί για να ξεκινήσει το Data Wrangler, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Εκκινήστε το Data Wrangler από ένα κελί
Μπορείτε επίσης να ανοίξετε το Data Wrangler απευθείας από ένα κελί σημειωματάριου, χωρίς να μεταβείτε στην κορδέλα. Αυτό το ενσωματωμένο σημείο εισόδου εμφανίζει το Data Wrangler ακριβώς εκεί που εργάζεστε με τα DataFrames.
Όταν εκτελείτε ένα κελί που εξάγει ένα DataFrame, εμφανίζεται μια ερώτηση της Οργάνωσης δεδομένων σε επίπεδο κελιού. Επιλέξτε την προτροπή για να ανοίξετε αυτό το DataFrame στο Data Wrangler. Οι υποστηριζόμενες εντολές περιλαμβάνουν:
-
df.head()ήdf.head(n). -
df.tail()ήdf.tail(n). -
df.show()ήdf.show(n).
Εκτελέστε ένα κελί που εξάγει ένα DataFrame:
import pandas as pd df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/titanic.csv") df.head()Αφού ολοκληρωθεί η εκτέλεση του κελιού, εμφανίζεται μια προτροπή Data Wrangler στο κελί. Επιλέξτε Άνοιγμα στο Data Wrangler για να εκκινήσετε το Data Wrangler με το
dfDataFrame.
Όταν ένα κελί ορίζει πολλά πλαίσια δεδομένων, η προτροπή παρέχει ένα υπομενού που παραθέτει όλα τα πλαίσια δεδομένων στο κελί. Μπορείτε να ανοίξετε οποιαδήποτε από αυτές στην Οργάνωση δεδομένων, ακόμα και αυτές που δεν έχετε εκτυπώσει ρητά.
Εκτελέστε ένα κελί που ορίζει πολλά πλαίσια δεδομένων:
import pandas as pd titanic_df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/titanic.csv") iris_df = pd.read_csv("https://raw.githubusercontent.com/plotly/datasets/master/iris-data.csv") titanic_df.head() iris_df.head()Αφού ολοκληρωθεί η εκτέλεση του κελιού, επιλέξτε την προτροπή Data Wrangler στο κελί. Ένα υπομενού παραθέτει όλα τα πλαίσια δεδομένων που ορίζονται στο κελί. Επιλέξτε αυτό που θέλετε να εξερευνήσετε.
Φιλοδώρημα
Το υπομενού παραθέτει τα πλαίσια δεδομένων που ορίζονται στο τρέχον κελί. Για να ανοίξετε ένα DataFrame από ένα προηγούμενο κελί, εκτελέστε ένα νέο κελί που αναφέρεται σε αυτό ή χρησιμοποιήστε την αναπτυσσόμενη λίστα Data Wrangler στην Αρχική καρτέλα της κορδέλας για να περιηγηθείτε σε όλα τα ενεργά DataFrames.
Επιλογή προσαρμοσμένων δειγμάτων
Για να ανοίξετε ένα προσαρμοσμένο δείγμα οποιουδήποτε ενεργού DataFrame με το Data Wrangler, επιλέξτε Επιλογή προσαρμοσμένου δείγματος από την αναπτυσσόμενη λίστα, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Αυτή η ενέργεια ανοίγει ένα παράθυρο διαλόγου με επιλογές για τον καθορισμό του μεγέθους του επιθυμητού δείγματος (αριθμός γραμμών) και της μεθόδου δειγματοληψίας (πρώτες εγγραφές, τελευταίες εγγραφές ή τυχαίο σύνολο). Οι πρώτες 5.000 γραμμές του DataFrame λειτουργούν ως το προεπιλεγμένο μέγεθος δείγματος, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Προβολή συνοπτικών στατιστικών στοιχείων
Όταν φορτώνεται η Οργάνωση δεδομένων, εμφανίζει μια περιγραφική επισκόπηση του επιλεγμένου DataFrame στον πίνακα Summary . Αυτή η επισκόπηση περιλαμβάνει πληροφορίες σχετικά με τις διαστάσεις του DataFrame, τις τιμές που λείπουν και πολλά άλλα. Όταν επιλέγετε οποιαδήποτε στήλη στο πλέγμα της Οργάνωσης δεδομένων, ο πίνακας Summary ενημερώνεται για να εμφανίζει περιγραφικά στατιστικά στοιχεία για τη συγκεκριμένη στήλη. Οι γρήγορες πληροφορίες για κάθε στήλη είναι επίσης διαθέσιμες στην κεφαλίδα της.
Φιλοδώρημα
Τα στατιστικά στοιχεία και οι απεικονίσεις για συγκεκριμένες στήλες (τόσο στον πίνακα Σύνοψη όσο και στις κεφαλίδες στηλών) εξαρτώνται από τον τύπο δεδομένων στήλης. Για παράδειγμα, ένα ιστόγραμμα σε κάδους μιας αριθμητικής στήλης εμφανίζεται στην κεφαλίδα στήλης μόνο εάν η στήλη έχει μεταβληθεί ως αριθμητικός τύπος, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Περιήγηση σε λειτουργίες καθαρισμού δεδομένων
Ο πίνακας "Λειτουργίες" παρέχει μια λίστα με τις λειτουργίες καθαρισμού δεδομένων με δυνατότητα αναζήτησης. Όταν επιλέγετε μια λειτουργία καθαρισμού δεδομένων από τον πίνακα "Λειτουργίες ", πρέπει να παρέχετε μια στήλη ή στήλες προορισμού, μαζί με τυχόν απαραίτητες παραμέτρους για την ολοκλήρωση της λειτουργίας. Για παράδειγμα, η προτροπή για αριθμητική κλιμάκωση μιας στήλης απαιτεί μια νέα περιοχή τιμών, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Φιλοδώρημα
Μπορείτε να εφαρμόσετε μια μικρότερη επιλογή λειτουργιών από το μενού κάθε κεφαλίδας στήλης, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Λειτουργίες προεπισκόπησης και εφαρμογής
Το πλέγμα προβολής Data Wrangler κάνει αυτόματα προεπισκόπηση των αποτελεσμάτων μιας επιλεγμένης λειτουργίας και ο αντίστοιχος κώδικας εμφανίζεται αυτόματα στον πίνακα κάτω από το πλέγμα. Για να δεσμεύσετε τον κώδικα προεπισκόπησης, επιλέξτε Εφαρμογή σε οποιαδήποτε θέση. Για να διαγράψετε τον κώδικα προεπισκόπησης και να δοκιμάσετε μια νέα λειτουργία, επιλέξτε Απόρριψη όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Μόλις εφαρμόσετε μια λειτουργία, το πλέγμα εμφάνισης του Data Wrangler και τα συνοπτικά στατιστικά στοιχεία ενημερώνονται ώστε να αντικατοπτρίζουν τα αποτελέσματα. Ο κώδικας εμφανίζεται στη λίστα εκτέλεσης των δεσμευμένων λειτουργιών στον πίνακα Βήματα καθαρισμού , όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Φιλοδώρημα
Μπορείτε πάντα να αναιρέσετε το πιο πρόσφατο βήμα που εφαρμόσατε. Στον πίνακα Βήματα καθαρισμού , εμφανίζεται ένα εικονίδιο κάδου απορριμμάτων όταν τοποθετείτε το δείκτη του ποντικιού πάνω από το πιο πρόσφατο βήμα, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Αυτός ο πίνακας συνοψίζει τις λειτουργίες που υποστηρίζει αυτήν τη στιγμή το Data Wrangler:
| Λειτουργία | Περιγραφή |
|---|---|
| Ταξινόμηση | Ταξινόμηση στήλης σε αύξουσα ή φθίνουσα σειρά |
| Φίλτρο | Φιλτράρισμα γραμμών βάσει μίας ή περισσότερων συνθηκών |
| Κωδικοποιητής μίας πρόσβασης | Δημιουργήστε νέες στήλες για κάθε μοναδική τιμή σε μια υπάρχουσα στήλη, υποδεικνύοντας την παρουσία ή την απουσία αυτών των τιμών ανά γραμμή |
| Binarizer πολλαπλών ετικετών | Διαχωρίστε δεδομένα χρησιμοποιώντας ένα διαχωριστικό και δημιουργήστε νέες στήλες για κάθε κατηγορία, σημειώνοντας 1 εάν μια γραμμή έχει αυτήν την κατηγορία και 0 εάν δεν έχει αυτήν την κατηγορία |
| Αλλαγή τύπου στήλης | Αλλαγή του τύπου δεδομένων μιας στήλης |
| Απόθεση στήλης | Διαγραφή μίας ή περισσότερων στηλών |
| Επιλογή στήλης | Επιλέξτε μία ή περισσότερες στήλες για διατήρηση και διαγράψτε τις υπόλοιπες |
| Μετονομασία στήλης | Μετονομασία στήλης |
| Αποθέστε τις τιμές που λείπουν | Κατάργηση γραμμών με τιμές που λείπουν |
| Κατάργηση διπλότυπων γραμμών | Κατάργηση όλων των γραμμών που έχουν διπλότυπες τιμές σε μία ή περισσότερες στήλες |
| Συμπληρώστε τις τιμές που λείπουν | Αντικατάσταση κελιών με τιμές που λείπουν με μια νέα τιμή |
| Εύρεση και αντικατάσταση | Αντικατάσταση κελιών με μοτίβο ακριβούς αντιστοίχισης |
| Ομαδοποίηση κατά στήλη και συγκεντρωτική τιμή | Ομαδοποίηση κατά τιμές στήλης και συγκεντρωτικά αποτελέσματα |
| Κενό διάστημα λωρίδας | Κατάργηση κενών διαστημάτων από την αρχή και το τέλος του κειμένου |
| Διαίρεση κειμένου | Διαίρεση μιας στήλης σε πολλές στήλες με βάση έναν οριοθέτη που ορίζεται από τον χρήστη |
| Μετατροπή κειμένου σε πεζά | Μετατροπή κειμένου σε πεζά |
| Μετατροπή κειμένου σε κεφαλαία | Μετατροπή κειμένου σε ΚΕΦΑΛΑΊΑ |
| Ελάχιστη/μέγιστη κλίμακα τιμών | Αλλαγή κλίμακας μιας αριθμητικής στήλης μεταξύ μιας ελάχιστης και μέγιστης τιμής |
| Γέμισμα flash | Αυτόματη δημιουργία νέας στήλης βάσει παραδειγμάτων που προέρχονται από μια υπάρχουσα στήλη |
Προσαρμόστε την οθόνη σας
Ανά πάσα στιγμή, μπορείτε να προσαρμόσετε τη διεπαφή χρησιμοποιώντας την καρτέλα "Προβολές" στη γραμμή εργαλείων πάνω από το πλέγμα εμφάνισης του Data Wrangler. Αυτή η επιλογή μπορεί να αποκρύψει ή να εμφανίσει διαφορετικά παράθυρα με βάση τις προτιμήσεις σας και το μέγεθος της οθόνης, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Αποθήκευση και εξαγωγή κώδικα
Η γραμμή εργαλείων πάνω από το πλέγμα εμφάνισης του Data Wrangler παρέχει επιλογές για την αποθήκευση του κώδικα που δημιουργήθηκε. Μπορείτε να αντιγράψετε τον κώδικα στο πρόχειρο ή να τον εξαγάγετε στο σημειωματάριο ως λειτουργία. Η εξαγωγή του κώδικα κλείνει το Data Wrangler και προσθέτει τη νέα συνάρτηση σε ένα κελί κώδικα στο σημειωματάριο. Μπορείτε επίσης να κατεβάσετε το καθαρισμένο DataFrame ως αρχείο CSV.
Φιλοδώρημα
Το Data Wrangler δημιουργεί κώδικα που εκτελείται μόνο όταν εκτελείτε με μη αυτόματο τρόπο το νέο κελί και δεν αντικαθιστά το αρχικό σας DataFrame, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Στη συνέχεια, μπορείτε να εκτελέσετε αυτόν τον εξαγόμενο κώδικα, όπως φαίνεται σε αυτό το στιγμιότυπο οθόνης:
Επόμενα βήματα
Τώρα που ξέρετε πώς να χρησιμοποιείτε το Data Wrangler με pandas DataFrames, εξερευνήστε αυτούς τους πόρους:
- Χρήση του Data Wrangler με Spark DataFrames - Εφαρμόστε τις ίδιες τεχνικές στο Spark DataFrames
- Παρακολουθήστε μια ζωντανή επίδειξη - Δείτε το Data Wrangler σε δράση με τον Guy in a Cube
- Δοκιμάστε το Data Wrangler στον κώδικα VS - Χρησιμοποιήστε το Data Wrangler στον κώδικα του Visual Studio
Έχετε σχόλια; Μοιραστείτε τις ιδέες σας στο φόρουμ Fabric Ideas.