Τι είναι η επιστήμη δεδομένων στο Microsoft Fabric;

Για τον εμπλουτισμό δεδομένων και τις επιχειρηματικές πληροφορίες, το Microsoft Fabric προσφέρει εμπειρίες επιστήμης δεδομένων που παρέχουν τη δυνατότητα στους χρήστες να δημιουργούν ροές εργασιών επιστήμης δεδομένων από άκρο σε άκρο. Οι φόρτοι εργασίας της επιστήμης δεδομένων λειτουργούν απευθείας σε ελεγχόμενα εταιρικά δεδομένα στο OneLake, ώστε να μπορείτε να έχετε πρόσβαση σε επιμελημένα σύνολα δεδομένων, κοινόχρηστα δεδομένα και προβλέψεις χωρίς να μετακινείτε δεδομένα μεταξύ συστημάτων. Για να ξεκινήσετε, ανατρέξτε στο ολοκληρωμένο πρόγραμμα εκμάθησης της Επιστήμης δεδομένων.

Μπορείτε να ολοκληρώσετε ένα ευρύ φάσμα δραστηριοτήτων σε ολόκληρη τη διαδικασία επιστήμης δεδομένων:

Οι χρήστες του Microsoft Fabric μπορούν να έχουν πρόσβαση σε μια αρχική σελίδα της Επιστήμης δεδομένων. Στη συνέχεια, μπορούν να ανακαλύψουν και να αποκτήσουν πρόσβαση σε διάφορους σχετικούς πόρους, όπως φαίνεται στο παρακάτω στιγμιότυπο οθόνης:

Στιγμιότυπο οθόνης της αρχικής σελίδας της Επιστήμης δεδομένων.

Τα περισσότερα έργα εκμάθησης μηχανής ακολουθούν τη διαδικασία επιστήμης δεδομένων. Σε υψηλό επίπεδο, αυτή η διαδικασία περιλαμβάνει τα εξής βήματα:

διάγραμμα της διαδικασίας επιστήμης δεδομένων.

Αυτό το άρθρο περιγράφει τις δυνατότητες της επιστήμης δεδομένων Microsoft Fabric από την άποψη της διαδικασίας επιστήμης δεδομένων. Για κάθε βήμα της διαδικασίας επιστήμης δεδομένων, αυτό το άρθρο συνοψίζει τις δυνατότητες του Microsoft Fabric που μπορούν να βοηθήσουν.

Διαμόρφωση προβλήματος και ιδέα

Οι χρήστες της επιστήμης δεδομένων στο Microsoft Fabric εργάζονται στην ίδια πλατφόρμα με τους επιχειρηματικούς χρήστες και αναλυτές. Ως αποτέλεσμα, η κοινή χρήση δεδομένων και η συνεργασία γίνονται πιο απρόσκοπτες σε διαφορετικούς ρόλους. Οι αναλυτές μπορούν εύκολα να μοιράζονται αναφορές και σύνολα δεδομένων του Power BI με επαγγελματίες της επιστήμης των δεδομένων. Η ευκολία συνεργασίας μεταξύ ρόλων στο Microsoft Fabric κάνει ευκολότερη την παράδοση κατά τη διάρκεια της φάσης διατύπωσης προβλημάτων. Η κοινή χρήση δεδομένων μεταξύ μισθωτών στο OneLake επιτρέπει περαιτέρω τη συνεργασία πολλών οργανισμών, επιτρέποντας στις ομάδες επιστήμης δεδομένων να έχουν πρόσβαση σε ελεγχόμενα σύνολα δεδομένων που μοιράζονται εξωτερικοί συνεργάτες ή θυγατρικές.

Εντοπισμός και προεπεξεργασία δεδομένων

Οι χρήστες του Microsoft Fabric μπορούν να αλληλεπιδράσουν με δεδομένα στο OneLake χρησιμοποιώντας τον πόρο Lakehouse. Για να περιηγηθείτε και να αλληλεπιδράσετε με δεδομένα, το Lakehouse συνδέεται εύκολα σε ένα σημειωματάριο. Οι χρήστες μπορούν να διαβάζουν εύκολα δεδομένα από ένα Lakehouse απευθείας σε ένα πλαίσιο δεδομένων Pandas. Για την εξερεύνηση, οι απρόσκοπτες αναγνώσεις δεδομένων από το OneLake γίνονται τότε δυνατές.

Οι συντομεύσεις OneLake επεκτείνουν αυτήν τη δυνατότητα παρέχοντας πρόσβαση χωρίς αντιγραφή σε δεδομένα που είναι αποθηκευμένα σε εξωτερικά συστήματα ή κοινόχρηστα από άλλους χώρους εργασίας και μισθωτές Fabric. Μπορείτε να επισυνάψετε μια συντόμευση σε μια λίμνη και να διαβάσετε τα αναφερόμενα δεδομένα σε σημειωματάρια χωρίς διπλότυπο ή ETL.

Ένα ισχυρό σύνολο εργαλείων είναι διαθέσιμο για διοχετεύσεις πρόσληψης δεδομένων και ενορχήστρωσης δεδομένων με διοχετεύσεις ενοποίησης δεδομένων - ένα εγγενώς ενσωματωμένο τμήμα του Microsoft Fabric. Οι εύκολοι στην κατασκευή αγωγοί μπορούν να έχουν πρόσβαση και να μετατρέψουν τα δεδομένα σε μια μορφή που μπορεί να καταναλώσει η μηχανική εκμάθηση.

Εξερεύνηση δεδομένων

Ένα σημαντικό μέρος της διαδικασίας εκμάθησης μηχανής είναι η κατανόηση των δεδομένων μέσω εξερεύνησης και απεικόνισης.

Ανάλογα με τη θέση αποθήκευσης δεδομένων, το Microsoft Fabric προσφέρει εργαλεία για να εξερευνήσετε και να προετοιμάσετε τα δεδομένα για ανάλυση και εκμάθηση μηχανής. Τα ίδια τα σημειωματάρια γίνονται αποτελεσματικά εργαλεία εξερεύνησης δεδομένων.

Apache Spark και Python για την προετοιμασία δεδομένων

Το Microsoft Fabric μπορεί να μετασχηματίσει, να προετοιμάσει και να εξερευνήσει τα δεδομένα σας με δυνατότητα κλιμάκωσης. Με το Spark, οι χρήστες μπορούν να χρησιμοποιούν τα εργαλεία PySpark/Python, Scala και SparkR/SparklyR για την προεπεξεργασία δεδομένων σε κλίμακα. Οι ισχυρές βιβλιοθήκες απεικονίσεων ανοιχτού κώδικα μπορούν να βελτιώσουν την εμπειρία εξερεύνησης δεδομένων για καλύτερες γνώσεις στα δεδομένα.

Data Wrangler για απρόσκοπτο καθαρισμό δεδομένων

Για να χρησιμοποιήσετε το Data Wrangler, η εμπειρία του Σημειωματάριου Microsoft Fabric πρόσθεσε μια δυνατότητα εργαλείου κώδικα που προετοιμάζει δεδομένα και δημιουργεί κώδικα Python. Αυτή η εμπειρία διευκολύνει την επιτάχυνση κουραστικών και ανιαρών εργασιών - για παράδειγμα, εκκαθάριση δεδομένων. Με αυτό, μπορείτε επίσης να δημιουργήσετε αυτοματισμό και επαναληψιμότητα μέσω του κώδικα που δημιουργείται. Μάθετε περισσότερα σχετικά με το Data Wrangler στην ενότητα Data Wrangler αυτού του εγγράφου.

Πειραματισμός και μοντελοποίηση εκμάθησης μηχανής

Με εργαλεία όπως τα PySpark/Python και SparklyR/R, τα σημειωματάρια μπορούν να χειριστούν την εκπαίδευση μοντέλου εκμάθησης μηχανής. Οι αλγόριθμοι και οι βιβλιοθήκες εκμάθησης μηχανής μπορούν να βοηθήσουν στην εκπαίδευση μοντέλων εκμάθησης μηχανής. Τα εργαλεία διαχείρισης βιβλιοθήκης μπορούν να εγκαταστήσουν αυτές τις βιβλιοθήκες και αλγόριθμους. Οι χρήστες μπορούν, στη συνέχεια, να χρησιμοποιήσουν δημοφιλείς βιβλιοθήκες εκμάθησης μηχανής για να ολοκληρώσουν την εκπαίδευση του μοντέλου εκμάθησης μηχανής στο Microsoft Fabric. Επιπλέον, δημοφιλείς βιβλιοθήκες όπως το Scikit Learn μπορούν επίσης να αναπτύξουν μοντέλα.

Τα πειράματα και οι εκτελέσεις MLflow μπορούν να παρακολουθούν την εκπαίδευση του μοντέλου εκμάθησης μηχανής. Για την καταγραφή πειραμάτων και μοντέλων, το Microsoft Fabric προσφέρει μια ενσωματωμένη εμπειρία MLflow που υποστηρίζει την αλληλεπίδραση. Μάθετε περισσότερα σχετικά με τον τρόπο χρήσης του MLflow για την παρακολούθηση πειραμάτων και τη διαχείριση μοντέλων στο Microsoft Fabric.

SynapseML

Η Microsoft κατέχει και διαχειρίζεται τη βιβλιοθήκη ανοιχτού κώδικα SynapseML (παλαιότερα γνωστή ως MMLSpark). Απλοποιεί τη δημιουργία μαζικά επεκτάσιμων αγωγών μηχανικής μάθησης. Ως οικοσύστημα εργαλείων, επεκτείνει το πλαίσιο Apache Spark σε διάφορες νέες κατευθύνσεις. Το SynapseML ενοποιεί πολλά υπάρχοντα πλαίσια μηχανικής εκμάθησης και νέους αλγόριθμους της Microsoft σε ένα ενιαίο, επεκτάσιμο API. Η βιβλιοθήκη ανοιχτού κώδικα SynapseML περιλαμβάνει ένα πλούσιο οικοσύστημα εργαλείων ML για ανάπτυξη προγνωστικών μοντέλων και χρησιμοποιεί προεκπαιδευμένα μοντέλα AI από το Foundry Tools. Για περισσότερες πληροφορίες, επισκεφθείτε τον πόρο SynapseML .

Εμπλουτισμός και λειτουργία

Τα σημειωματάρια μπορούν να χειρίζονται τη βαθμολόγηση δέσμης μοντέλων εκμάθησης μηχανής με βιβλιοθήκες ανοιχτού κώδικα για πρόβλεψη. Μπορούν επίσης να χειριστούν την καθολική συνάρτηση Spark Predict με δυνατότητα κλιμάκωσης Microsoft Fabric. Αυτή η συνάρτηση υποστηρίζει μοντέλα σε πακέτο MLflow στο μητρώο μοντέλου Microsoft Fabric.

Απόκτηση πληροφοριών

Στο Microsoft Fabric, μπορείτε εύκολα να συντάξετε προβλεπόμενες τιμές στο OneLake. Από εκεί, οι αναφορές Power BI μπορούν να τις καταναλώσουν απρόσκοπτα με τη λειτουργία Power BI Direct Lake, η οποία διαβάζει δεδομένα απευθείας από το OneLake χωρίς να τα αντιγράφει στο μοντέλο σημασιολογίας. Αυτό το μοτίβο πρόσβασης χωρίς αντιγραφή διατηρεί ενημερωμένες τις προβλέψεις και εξαλείφει την περιττή μετακίνηση δεδομένων. Οι επαγγελματίες της επιστήμης δεδομένων μπορούν στη συνέχεια να μοιραστούν εύκολα τα αποτελέσματα της εργασίας τους με τα ενδιαφερόμενα μέρη και απλοποιεί τη λειτουργικότητα.

Μπορείτε να χρησιμοποιήσετε δυνατότητες προγραμματισμού σημειωματάριου για να προγραμματίσετε εκτελέσεις σημειωματάριων που περιέχουν βαθμολόγηση δέσμης. Μπορείτε επίσης να προγραμματίσετε τη βαθμολόγηση παρτίδας ως μέρος δραστηριοτήτων διοχέτευσης ή εργασιών Spark. Με τη λειτουργία Direct lake στο Microsoft Fabric, το Power BI λαμβάνει αυτόματα τις τελευταίες προβλέψεις χωρίς την ανάγκη για φόρτους δεδομένων ή ανανεώσεις.

Οι επιστήμονες δεδομένων και οι επιχειρηματικοί αναλυτές αφιερώνουν πολύ χρόνο στην προσπάθεια κατανόησης, εκκαθάρισης και μετασχηματισμού των δεδομένων, προκειμένου να μπορέσει να ξεκινήσει μια ουσιαστική ανάλυση. Οι επιχειρηματικοί αναλυτές συνήθως εργάζονται με σημασιολογικά μοντέλα και κωδικοποιούν τις γνώσεις τομέα και την επιχειρηματική λογική τους σε μετρήσεις Power BI. Από την άλλη πλευρά, οι επιστήμονες δεδομένων μπορούν να εργαστούν με τα ίδια δεδομένα, αλλά συνήθως χρησιμοποιούν διαφορετικό περιβάλλον κώδικα ή γλώσσα. Με τη σημασιολογική σύνδεση, οι επιστήμονες δεδομένων μπορούν να δημιουργήσουν μια σύνδεση μεταξύ των σημασιολογικών μοντέλων Power BI και της επιστήμης δεδομένων Synapse στην εμπειρία Microsoft Fabric μέσω της βιβλιοθήκης SemPy Python. Για να απλοποιήσει την ανάλυση δεδομένων, το SemPy καταγράφει και χρησιμοποιεί σημασιολογία δεδομένων καθώς οι χρήστες εκτελούν διάφορους μετασχηματισμούς στα σημασιολογικά μοντέλα. Όταν οι επιστήμονες δεδομένων χρησιμοποιούν σημασιολογική σύνδεση, μπορούν

  • αποφύγετε την εκ νέου εφαρμογή της επιχειρηματικής λογικής και της γνώσης τομέα στον κείμενό τους
  • εύκολη πρόσβαση και χρήση μετρήσεων Power BI στον κείμενό τους
  • χρήση σημασιολογίας για την παροχή νέων εμπειριών - για παράδειγμα, σημασιολογικές συναρτήσεις
  • εξερεύνηση και επικύρωση λειτουργικών εξαρτήσεων και σχέσεων μεταξύ δεδομένων

Όταν οι οργανισμοί χρησιμοποιούν το SemPy, μπορούν να περιμένουν

  • αυξημένη παραγωγικότητα και ταχύτερη συνεργασία μεταξύ των ομάδων που λειτουργούν στα ίδια σύνολα δεδομένων
  • αυξημένη συνεργασία μεταξύ ομάδων επιχειρηματικής ευφυΐας και τεχνητής νοημοσύνης
  • μειωμένη ασάφεια και μια ευκολότερη καμπύλη εκμάθησης κατά την προσθήκη λογαριασμών σε ένα νέο μοντέλο ή σύνολο δεδομένων

Για περισσότερες πληροφορίες σχετικά με τη σημασιολογική σύνδεση, ανατρέξτε στο θέμα Τι είναι η σημασιολογική σύνδεση;.