Συντήρηση και βελτιστοποίηση πίνακα μεταξύ φόρτων εργασίας στο Microsoft Fabric

Οι πίνακες Delta στο Microsoft Fabric μπορούν να εξυπηρετήσουν το Spark, το τελικό σημείο ανάλυσης SQL, το Power BI Direct Lake, το Warehouse και άλλες εμπειρίες Fabric από δεδομένα που είναι αποθηκευμένα στο OneLake. Η βέλτιστη απόδοση μεταξύ φόρτων εργασίας εξαρτάται από δύο παράγοντες:

  • Ο φόρτος εργασίας που δημιουργεί και διατηρεί τον πίνακα.
  • Οι κινητήρες που καταναλώνουν το τραπέζι.

Η διαχείριση των πινάκων Lakehouse γίνεται συνήθως από το Spark, τη διοχέτευση Fabric Copy activity ή το Dataflow Gen2. Το Spark είναι το πιο κοινό πρόγραμμα εγγραφής και παρέχει τα ευρύτερα στοιχεία ελέγχου διάταξης και συντήρησης. Ο κατοπτρισμός αποθήκης και βάσης δεδομένων διαχειρίζεται αυτόματα τις φυσικές τους διατάξεις. Οι κατοπτρικοί κατάλογοι διατηρούν τη διάταξη που διαχειρίζεται το σύστημα προέλευσης. Οι απαιτήσεις των καταναλωτών είναι γενικά συμβατές, αλλά το Power BI Direct Lake έχει πρόσθετες απαιτήσεις αποθήκευσης για βέλτιστες επιδόσεις.

Χρησιμοποιήστε έναν κοινόχρηστο πίνακα όποτε οι απαιτήσεις του είναι συμβατές. Για τις εξαιρέσεις που δικαιολογούν έναν άλλο πίνακα, ανατρέξτε στο θέμα Πότε να δημιουργήσετε έναν άλλο πίνακα.

Κατανόηση της ιδιοκτησίας διάταξης

Ξεκινήστε προσδιορίζοντας σε ποιον φόρτο εργασίας ανήκει η διάταξη του φυσικού πίνακα. Τα στοιχεία ελέγχου στον παρακάτω πίνακα είναι τα βασικά στοιχεία ελέγχου που σχετίζονται με τη διάταξη και τη συντήρηση του πίνακα διασταυρούμενου φόρτου εργασίας και όχι μια εξαντλητική λίστα των δυνατοτήτων κάθε κινητήρα.

Χώρος αποθήκευσης δεδομένων Μέθοδος εγγραφής ή κατάποσης Ιδιοκτησία διάταξης και συντήρησης Βασικά στοιχεία ελέγχου
Lakehouse Spark Διαχείριση από τον χρήστη Μέγεθος αρχείου: προσαρμοστικό μέγεθος αρχείου στόχου και στόχοι συμπίεσης σε επίπεδο αρχείου.
Εγγραφή και συντήρηση: διανύσματα διαγραφής, αυτόματη συμπύκνωση, βελτιστοποίηση εγγραφήςOPTIMIZE και VACUUM.
Οργάνωση δεδομένων: ρευστή ομαδοποίηση, κατάτμηση, Z-Order και V-Order.
Lakehouse Fabric pipeline Copy activity ή Dataflow Gen2 Η υπηρεσία γράφει τα δεδομένα. Ο ιδιοκτήτης του Lakehouse συντηρεί το τραπέζι Ρυθμίσεις εγγραφής για συγκεκριμένο προορισμό. Εκτελέστε τη συμβατή συντήρηση ξεχωριστά χρησιμοποιώντας το Spark, τη συντήρηση Lakehouse ή μια δραστηριότητα συντήρησης διοχέτευσης.
Αποθήκη Fabric αποθήκη δεδομένων, Copy activity διοχέτευσης Fabric ή Dataflow Gen2 Διαχείριση αποθήκης Ομαδοποίηση δεδομένων και ρύθμιση V-Order σε επίπεδο αποθήκης.
Αντικείμενο με καθρέφτη Υπηρεσία κατοπτρισμού Εξαρτάται από τον τύπο κατοπτρισμού Ο κατοπτρισμός βάσης δεδομένων χρησιμοποιεί μια διάταξη V-Ordered Delta διαχειριζόμενη από το σύστημα χωρίς άμεσους ελέγχους διάταξης. Οι κατοπτριζόμενοι κατάλογοι διατηρούν τη διάταξη του αρχείου προέλευσης, την οποία μπορείτε να βελτιστοποιήσετε στο σύστημα προέλευσης όταν υποστηρίζεται.

Καθοδήγηση μεταξύ φόρτου εργασίας

Ο παρακάτω πίνακας συνοψίζει τη συνιστώμενη προσέγγιση από τον παραγωγό και τον καταναλωτή.

Παραγωγός Καταναλωτής Προτεινόμενη προσέγγιση
Lakehouse: Συγγραφέας Spark Spark Χρησιμοποιήστε τις προεπιλογές χρόνου εκτέλεσης Fabric Spark 2.0 ή νεότερες εκδόσεις και ενεργοποιήστε την αυτόματη συμπύκνωση. Εξετάστε το ενδεχόμενο ομαδοποίησης υγρών όταν τα μετρούμενα κατηγορήματα επωφελούνται από τη βελτιωμένη παράβλεψη αρχείων.
Lakehouse: Συγγραφέας Spark Τελικό σημείο ανάλυσης SQL Χρησιμοποιήστε την ίδια διάταξη που προτείνεται για το Spark. Μην ορίζετε στατικό μέγεθος αρχείου προορισμού, αυθαίρετο όριο γραμμών ή V-Order αποκλειστικά για την απόδοση τελικού σημείου ανάλυσης SQL.
Lakehouse: Συγγραφέας Spark Λίμνη Power BI Direct Χρησιμοποιήστε την ίδια διάταξη που συνιστάται για το Spark και ενεργοποιήστε επιπλέον το V-Order ή χρησιμοποιήστε το readHeavyForPBI προφίλ πόρων.
Lakehouse: Διοχέτευση Fabric ή εγγραφή ροής δεδομένων Gen2 Spark, τελικό σημείο ανάλυσης SQL ή Power BI Direct Lake Παρακολουθήστε τη διάταξη του αρχείου που προκύπτει και προγραμματίστε ξεχωριστά τη συμβατή συντήρηση του lakehouse. Ορισμένες λειτουργίες προορισμού, όπως η επαυξητική ανανέωση ροής δεδομένων Gen2, επιβάλλουν περιορισμούς συντήρησης.
Αποθήκη Fabric αποθήκη δεδομένων ή Spark Χρησιμοποιήστε τη διάταξη που διαχειρίζεται το σύστημα. Fabric αποθήκη δεδομένων διαχειρίζεται αυτόματα τη συμπύκνωση και άλλες εργασίες συντήρησης. Χρησιμοποιήστε τη δημιουργία συμπλεγμάτων δεδομένων για να βελτιώσετε την παράβλεψη αρχείων για φόρτους εργασίας με επαναλαμβανόμενα επιλεκτικά κατηγορήματα.
Αποθήκη Λίμνη Power BI Direct Διατηρήστε την προεπιλεγμένη ρύθμιση V-Order αποθήκης. Χρησιμοποιήστε την ομαδοποίηση δεδομένων όταν ωφελεί κοινόχρηστα μοτίβα ερωτημάτων.
Mirroring Spark, τελικό σημείο ανάλυσης SQL ή Power BI Direct Lake Για κατοπτρισμό βάσης δεδομένων, χρησιμοποιήστε τη διάταξη V-Ordered Delta που διαχειρίζεται το σύστημα. Για καταλόγους κατοπτρισμού, βελτιστοποιήστε τα υποκείμενα αρχεία στο σύστημα προέλευσης όταν υποστηρίζεται. Δείτε Τι είναι το Mirroring in Fabric;.

Βελτιστοποίηση πινάκων Lakehouse

Οι πίνακες Lakehouse Delta απαιτούν μια ρητή στρατηγική συντήρησης, ανεξάρτητα από το αν τους εγγράφει το Spark, το Pipeline Copy activity ή το Dataflow Gen2. Το Spark είναι το κύριο παράδειγμα σε αυτήν την ενότητα, επειδή παρέχει τα ευρύτερα στοιχεία ελέγχου διάταξης και συντήρησης στο Fabric.

Σημαντικό

Η συντήρηση του πίνακα είναι κρίσιμη για τη βέλτιστη απόδοση εγγραφής και ανάγνωσης σε όλους τους κινητήρες. Ακόμη και οι φόρτοι εργασίας μόνο για προσάρτηση που αρχικά έχουν καλή απόδοση χωρίς συντήρηση μπορούν να συσσωρεύσουν υπερβολικά μικρά αρχεία, τα οποία επηρεάζουν το Spark, το τελικό σημείο ανάλυσης SQL, το Direct Lake και τα εξωτερικά προγράμματα ανάγνωσης δεδομένων. Δείτε Πίνακες συμπίεσης Delta για μεθόδους αυτόματης και χειροκίνητης συμπίεσης.

Χρήση των προεπιλογών χρόνου εκτέλεσης Spark

Όταν το Spark γράφει τον πίνακα, χρησιμοποιήστε τις προεπιλογές χρόνου εκτέλεσης Fabric Spark 2.0 ή νεότερης έκδοσης:

Στο χρόνο εκτέλεσης Fabric Spark 1.3, το προσαρμόσιμο μέγεθος αρχείου προορισμού, οι στόχοι συμπίεσης σε επίπεδο αρχείου και τα διανύσματα διαγραφής είναι διαθέσιμα ως ρυθμίσεις συγκατάθεσης.

Όταν το Pipeline Copy activity ή το Dataflow Gen2 εγγράφει τον πίνακα, ελέγξτε τη διάταξη του αρχείου που προκύπτει και προγραμματίστε τη συντήρηση ξεχωριστά. Μην υποθέτετε ότι αυτοί οι συντάκτες εφαρμόζουν προεπιλογές χρόνου εκτέλεσης Spark.

Σημαντικό

Οι προορισμοί lakehouse ροής δεδομένων Gen2 που χρησιμοποιούν επαυξητική ανανέωση δεν υποστηρίζουν OPTIMIZE ή REORG TABLE. Ακολουθήστε τους περιορισμούς επαυξητικής ανανέωσης ροής δεδομένων Gen2.

Αποτρέψτε και συμπυκνώστε μικρά αρχεία

Για πίνακες γραμμένους με Spark, προτιμήστε την αυτόματη συμπύκνωση. Αυτή η δυνατότητα αξιολογεί τον κατακερματισμό του πίνακα μετά την εγγραφή και εκτελεί τη συμπίεση μόνο όταν χρειάζεται. Εξαλείφει την ανάγκη για ξεχωριστό έλεγχο της υγείας του τραπεζιού πριν από την εκτέλεση της συντήρησης.

Χρησιμοποιήστε τις παρακάτω οδηγίες για εξαιρέσεις και συμπληρωματικές δυνατότητες:

Σενάριο Προτεινόμενη προσέγγιση
Τραπέζι γραμμένο με σπινθήρα Ενεργοποιήστε την αυτόματη συμπίεση ως προεπιλεγμένη στρατηγική συντήρησης.
Η ροή ή η μικροπαρτίδα γράφει Ενεργοποιήστε την αυτόματη συμπίεση και βελτιστοποιήστε την εγγραφή για να μειώσετε τη συσσώρευση μικρών αρχείων.
Φόρτοι εργασίας με αυστηρές απαιτήσεις καθυστέρησης εγγραφής Προγραμματίστε OPTIMIZE ξεχωριστά αντί να εκτελείτε σύγχρονη αυτόματη συμπύκνωση.
Υπάρχων πίνακας με συσσωρευμένα μικρά αρχεία Εκτελέστε μια εφάπαξ και, στη OPTIMIZEσυνέχεια, ενεργοποιήστε την αυτόματη συμπίεση για συνεχή συντήρηση.
Πίνακες με συχνές ενημερώσεις, διαγραφές ή συγχωνεύσεις Διατηρήστε ενεργοποιημένα τα διανύσματα διαγραφής και τηναυτόματη συμπύκνωση .

OPTIMIZE Συμπυκνώνει αρχεία και εκκαθαρίζει αυτόματα τα διανύσματα διαγραφής ενός αρχείου όταν περισσότερα από 5% των εγγραφών του αναφέρονται από διανύσματα διαγραφής. Χρησιμοποιήστε μόνο REORG TABLE ... APPLY (PURGE) όταν πρέπει να εκκαθαρίσετε φυσικά αρχεία κάτω από αυτό το όριο ή να ικανοποιήσετε μια συγκεκριμένη απαίτηση συμμόρφωσης.

Σημείωμα

Η αυτόματη συμπύκνωση εκκαθαρίζει τα διανύσματα διαγραφής μόνο όταν το διαμέρισμα πληροί επίσης το έναυσμα μικρού αρχείου. Εάν ένας φόρτος εργασίας εκτελεί ενημερώσεις ή διαγράφει χωρίς να δημιουργεί μικρά αρχεία, εκτελέστε OPTIMIZE περιοδικά για να εκκαθαρίσετε τα κατάλληλα διανύσματα διαγραφής. Χρησιμοποιήστε το REORG TABLE ... APPLY (PURGE) όταν πρέπει να αναγκάσετε μια φυσική εκκαθάριση.

Εκτελέστε VACUUM σε ξεχωριστό χρονοδιάγραμμα για να καταργήσετε αρχεία χωρίς αναφορά μετά την περίοδο διατήρησης. VACUUM Ανακτά τον χώρο αποθήκευσης, αλλά δεν βελτιώνει την ενεργή διάταξη αρχείων.

Προειδοποίηση

Μην συντομεύετε την VACUUM περίοδο διατήρησης χωρίς να αξιολογήσετε τις απαιτήσεις ταξιδιού στο χρόνο και τους ταυτόχρονους αναγνώστες ή συγγραφείς. Η κατάργηση αρχείων πολύ νωρίς μπορεί να καταστήσει μη διαθέσιμες τις απαιτούμενες εκδόσεις πίνακα.

Οργάνωση δεδομένων για παράβλεψη αρχείων

Χρησιμοποιήστε ομαδοποίηση υγρών όταν τα επαναλαμβανόμενα μοτίβα φίλτρων ή επεξεργασίας επωφελούνται από τη βελτιωμένη παράβλεψη αρχείων. Οι πίνακες συμπλέγματος υγρών απαιτούν OPTIMIZEή αυτόματη συμπύκνωση για την οργάνωση πρόσφατα γραμμένων δεδομένων.

Αποφύγετε την κατάτμηση από προεπιλογή. Χρησιμοποιήστε το όταν μια συγκεκριμένη απαίτηση δικαιολογεί τις λειτουργικές ανταλλαγές, όπως η απομόνωση ταυτόχρονων εγγραφών που ενημερώνουν, διαγράφουν ή συγχωνεύουν δεδομένα σε ασύνδετα διαμερίσματα. Για περισσότερες πληροφορίες, δείτε την ενότητα Πότε να χρησιμοποιήσετε τη διαμέριση.

Για υπάρχοντες διαμερισμένους πίνακες, εξετάστε το Z-Order όταν τα επιλεκτικά κατηγορήματα συνήθως φιλτράρονται στις ίδιες στήλες μέσα σε ένα διαμέρισμα.

Βελτιστοποίηση πινάκων διαχειριζόμενων από αποθήκη

Fabric αποθήκη δεδομένων διαχειρίζεται τη φυσική διάταξη του πίνακα Delta ανεξάρτητα από τη μέθοδο πρόσληψης.

Χρησιμοποιήστε τους στρατηγικούς ελέγχους που εκθέτει το Warehouse για να συντονίσετε τη διάταξη δεδομένων:

  • Εφαρμόστε ομαδοποίηση δεδομένων σε μεγάλους πίνακες όταν τα ερωτήματα χρησιμοποιούν επανειλημμένα επιλεκτικά κατηγορήματα στις ίδιες στήλες.
  • Διατηρήστε το V-Order ενεργοποιημένο για φόρτους εργασίας προσανατολισμένους στην ανάγνωση και μικτούς φόρτους εργασίας. Το V-Order είναι ενεργοποιημένο από προεπιλογή.
  • Εξετάστε το ενδεχόμενο να απενεργοποιήσετε το V-Order για φόρτους εργασίας αποθήκης με υψηλές απαιτήσεις εγγραφής.

Προειδοποίηση

Η απενεργοποίηση του V-Order είναι μια μη αναστρέψιμη λειτουργία σε επίπεδο αποθήκης. Ελέγξτε τον πλήρη φόρτο εργασίας ανάγνωσης και εγγραφής πριν τον απενεργοποιήσετε.

Για πλήρη καθοδήγηση σχετικά με την Αποθήκη, ανατρέξτε στις Οδηγίες απόδοσης στο Fabric αποθήκη δεδομένων.

Βελτιστοποίηση κατοπτρικών δεδομένων

Η ικανότητά σας να βελτιώσετε τη φυσική διάταξη εξαρτάται από το αν το Fabric αναπαράγει τα δεδομένα ή παραπέμπει σε αρχεία προέλευσης:

  • Κατοπτρισμός βάσης δεδομένων: Το Fabric αναπαράγει δεδομένα προέλευσης σε πίνακες Delta στο OneLake και διαχειρίζεται τη διάταξη και τη συντήρηση του αρχείου V-Order. Δεν μπορείτε να διαμορφώσετε απευθείας το μέγεθος του αρχείου προορισμού, την εκκαθάριση διανύσματος διαγραφής, τη δημιουργία συμπλεγμάτων υγρών, την κατάτμηση ή τη διάταξη V στον κατοπτρικό προορισμό.
  • Κατοπτρικοί κατάλογοι: Το Fabric συγχρονίζει μετα-δεδομένα και χρησιμοποιεί συντομεύσεις OneLake για αναφορά σε δεδομένα προέλευσης στη θέση τους. Fabric δεν ξαναγράφει ούτε συντηρεί αυτά τα αρχεία. Βελτιώστε τη φυσική διάταξη και τον καθαρισμό στο σύστημα προέλευσης όταν το επιτρέπουν οι υποστηριζόμενες λειτουργίες του. Αυτές οι αλλαγές είναι ορατές μέσω των συντομεύσεων χωρίς τη δημιουργία άλλου αντιγράφου στο Fabric.

Για δεδομένα κατοπτρισμού βάσης δεδομένων:

  • Χρησιμοποιήστε επιλεκτικά κατηγορήματα και αποφύγετε τις περιττές στήλες σε ερωτήματα Spark και SQL.
  • Σχεδίαση σημασιολογικών μοντέλων Power BI και μετρήσεων DAX για αποδοτική κατανάλωση Direct Lake.

Για καταλόγους με καθρέφτη:

  • Χρησιμοποιήστε τις υποστηριζόμενες δυνατότητες συντήρησης και διάταξης πινάκων της πλατφόρμας προέλευσης.
  • Αξιολογήστε την κατανομή του αρχείου προέλευσης και της ομάδας γραμμών για τους χρήστες του Fabric που υποβάλλουν ερωτήματα στις συντομεύσεις.
  • Για το Direct Lake, αξιολογήστε τη δημιουργία ενός πρόσθετου επιπέδου προβολής με διαστατική μοντελοποίηση, V-Ordered , όταν η διάταξη προέλευσης δεν μπορεί να ικανοποιήσει τις απαιτήσεις απόδοσης.

Για τις έννοιες, τους τύπους και τις υποστηριζόμενες προελεύσεις κατοπτρισμού, ανατρέξτε στα θέματα Τι είναι ο κατοπτρισμός στο Fabric; και Πώς λειτουργεί ο κατοπτρισμός μετα-δεδομένων.

Εφαρμογή βελτιστοποίησης ειδικά για τον καταναλωτή

Το τελικό σημείο ανάλυσης Spark και SQL έχει καλή απόδοση στην ίδια προσαρμόσιμη διάταξη lakehouse. Χρησιμοποιήστε προσαρμόσιμο μέγεθος αρχείου προορισμού, αποτρέψτε τα υπερβολικά μικρά αρχεία και εφαρμόστε ρευστή ομαδοποίηση όταν τα μετρούμενα κατηγορήματα επωφελούνται από τη βελτιωμένη παράβλεψη αρχείων. Μην ενεργοποιείτε το V-Order αποκλειστικά για την απόδοση τελικού σημείου ανάλυσης Spark ή SQL. Για λεπτομέρειες σχετικά με τον μηχανισμό, ανατρέξτε στο θέμα Ζητήματα απόδοσης τελικού σημείου ανάλυσης SQL.

Λίμνη Power BI Direct

Το Direct Lake χρησιμοποιεί τους ίδιους υποκείμενους πίνακες Delta, αλλά προσθέτει συστάσεις σχετικά με τη διακωδικοποίηση και το αυξητικό πλαίσιο:

  • Διάταξη αρχείων και ομάδων γραμμών: Αποφύγετε τις μικρές ομάδες γραμμών και την άνιση κατανομή ομάδων γραμμών, αυτό δημιουργεί περισσότερα τμήματα στηλών VertiPaq και αυξάνει την επιβάρυνση διακωδικοποίησης.
  • V-Order: Ακολουθήστε τη συγκεκριμένη σύσταση παραγωγού στην καθοδήγηση μεταξύ φόρτου εργασίας. Για πίνακες γραμμένους με Spark που καταναλώνονται κυρίως μέσω του Direct Lake, ενεργοποιήστε το V-Order ή χρησιμοποιήστε το readHeavyForPBI προφίλ πόρων.
  • Ενημέρωση μοτίβων: Προτιμήστε μοτίβα ενημέρωσης φιλικά προς την προσάρτηση , όπου είναι δυνατόν, για να διατηρήσετε τα υπάρχοντα αρχεία Parquet και να υποστηρίξετε το σταδιακό καδράρισμα.

Σημείωμα

Το Direct Lake γενικά αποδίδει καλύτερα με ομάδες σειρών μεταξύ 1 εκατομμυρίου και 16 εκατομμυρίων σειρών. Αξιολογήστε την κατανομή της ομάδας γραμμών και την απόδοση του Direct Lake πριν αλλάξετε μια υποστηριζόμενη ρύθμιση παραγωγού.

Για πίνακες γραμμένους με σπινθήρα, spark.sql.parquet.native.writer.maxRowGroupRowCount ορίζει τις μέγιστες γραμμές ανά ομάδα γραμμών όταν ο εγγενής μηχανισμός εκτέλεσης εγγράφει τα αρχεία Parquet. Η προεπιλεγμένη τιμή είναι 0, η οποία δεν επιβάλλει μέγιστο. Εάν η ανάλυση δείξει ότι το μέγεθος της ομάδας γραμμών επηρεάζει την απόδοση του Direct Lake, ορίστε ένα δοκιμασμένο όριο πριν γράψετε ή ξαναγράψετε τον πίνακα. Για παράδειγμα:

spark.conf.set("spark.sql.parquet.native.writer.maxRowGroupRowCount", 8_000_000)

Μην ορίζετε το όριο αποκλειστικά για να φτάσετε σε ένα συγκεκριμένο πλήθος σειρών. Το πλάτος της σειράς, η συμπίεση, η κατανομή αρχείων και ο παραλληλισμός χωρητικότητας επηρεάζουν επίσης την απόδοση. Χρησιμοποιήστε το Delta Analyzer για να αξιολογήσετε τη διάταξη που προκύπτει.

Για λεπτομερείς οδηγίες σχετικά με το καδράρισμα, τη διακωδικοποίηση, τις ομάδες γραμμών, τα μοτίβα ενημέρωσης και την Ανάλυση δέλτα, ανατρέξτε στο θέμα Κατανόηση των επιδόσεων ερωτημάτων Direct Lake.

Εφαρμόστε την καθοδήγηση σε στρώματα μενταγιόν

Ο Μπρούντζος, το Ασήμι και ο Χρυσός περιγράφουν τον σκοπό και τη βελτίωση των δεδομένων. Δεν καθορίζουν εάν η διάταξη διαχειρίζεται ο χρήστης ή το σύστημα και δεν απαιτούν ξεχωριστά αντίγραφα για κάθε καταναλωτή.

Στρώση Κύριος στόχος Καθοδήγηση μεταξύ φόρτου εργασίας
Χάλκινο (προσγείωση) Διατήρηση της πιστότητας προέλευσης και της ταχύτητας απορρόφησης Δώστε προτεραιότητα στην ταχύτητα εγγραφής διατηρώντας παράλληλα πίνακες γραμμένους με σπινθήρα με αυτόματη συμπύκνωση. Αποφύγετε τα σημασιολογικά μοντέλα Power BI Direct Lake σε ακατέργαστους πίνακες Bronze, εκτός εάν το μοντέλο και το σχήμα δεδομένων έχουν σχεδιαστεί σκόπιμα για αυτήν τη χρήση.
Ασήμι (επιμέλεια) Παρέχετε επικυρωμένα, συμμορφωμένα δεδομένα για επαναχρησιμοποίηση Χρησιμοποιήστε ξανά τον πίνακα σε συμβατούς καταναλωτές Fabric. Για πίνακες lakehouse γραμμένους με Spark, ενεργοποιήστε την Παραγγελία V-Order μόνο όταν η Direct Lake είναι κύριος καταναλωτής.
Χρυσός (μερίδα) Προβολή διαστάσεων, γεγονότων, συγκεντρωτικών στοιχείων και μοντέλων ανάλυσης έτοιμων για επιχειρήσεις Προτιμήστε αυτό το επίπεδο για σημασιολογικά μοντέλα Direct Lake. Χρησιμοποιήστε ξανά τον πίνακα σε συμβατούς καταναλωτές και εφαρμόστε τα στοιχεία ελέγχου για συγκεκριμένους παραγωγούς που περιγράφονται σε αυτό το άρθρο.

Επίλυση προβλημάτων διάταξης και συντήρησης

Χρησιμοποιήστε αποκατάσταση με επίγνωση του παραγωγού. Εφαρμόστε εντολές συντήρησης Spark σε πίνακες lakehouse όταν η λειτουργία προορισμού υποστηρίζει αυτές τις λειτουργίες. Αντιμετωπίστε τα σήματα ως δείκτες και όχι ως καθολικά όρια και επικυρώστε τα σε σχέση με το μοτίβο εγγραφής του πίνακα και την απόδοση των καταναλωτών.

Συνθήκη Σήμα Τραπέζι Lakehouse Πίνακας αποθήκης
Υπερβολικά μικρά αρχεία Ο αριθμός αρχείων αυξάνεται ταχύτερα από το μέγεθος του ενεργού πίνακα και τα αρχεία παραμένουν κάτω από τον προσαρμοστικό στόχο. Με το Spark, εκτελέστε μια εφάπαξ OPTIMIZE για το υπάρχον ανεκτέλεστο και, στη συνέχεια, ενεργοποιήστε την αυτόματη συμπύκνωση. Για τη δραστηριότητα διοχέτευσης Copy activity ή τις εγγραφές Dataflow Gen2, προγραμματίστε ξεχωριστά την υποστηριζόμενη συντήρηση lakehouse. Καμία ενέργεια. Η συμπύκνωση της αποθήκης είναι αυτόματη.
Αρχεία μεγάλου μεγέθους παλαιού τύπου Τα αρχεία παραμένουν πολύ υψηλότερα από τον τρέχοντα προσαρμοστικό στόχο και πολύ λίγα αρχεία περιορίζουν τον παραλληλισμό σάρωσης. Ξαναγράψτε τον πίνακα χρησιμοποιώντας μια αντικατάσταση ή CREATE OR REPLACE TABLE AS SELECT με ενεργοποιημένο το προσαρμόσιμο μέγεθος αρχείου προορισμού . Καμία ενέργεια. Η αποθήκη διαχειρίζεται αυτόματα το μέγεθος του αρχείου.
Συσσώρευση διανυσμάτων διαγραφής DESCRIBE HISTORY Οι μετρήσεις δείχνουν ότι τα διανύσματα διαγραφής προστίθενται ή ενημερώνονται πιο γρήγορα από ό,τι τα αφαιρεί η συμπίεση, αυξάνοντας ενδεχομένως τα γενικά έξοδα ανάγνωσης. Διατηρήστε ενεργοποιημένη την αυτόματη συμπύκνωση . Εάν συσσωρευτούν διανύσματα διαγραφής χωρίς να ενεργοποιηθεί η συμπίεση μικρών αρχείων, προγραμματίστε OPTIMIZE. Χρησιμοποιήστε μόνο REORG TABLE ... APPLY (PURGE) για ρητές απαιτήσεις εκκαθάρισης. Καμία ενέργεια. Η εκκαθάριση γίνεται από το σύστημα.
Κακή παράβλεψη αρχείων Τα επιλεκτικά κατηγορήματα σαρώνουν ένα μεγάλο μέρος του πίνακα ή η αξιολόγηση της ποιότητας ομαδοποίησης δείχνει κακή οργάνωση. Με το Spark, διαμορφώστε το ρευστό σύμπλεγμα ή χρησιμοποιήστε το Z-Order για έναν υπάρχοντα διαμερισμένο πίνακα. Διαμόρφωση συμπλέγματος δεδομένων αποθήκης.
Επιβάρυνση διακωδικοποίησης Direct Lake Το Delta Analyzer εμφανίζει υπερβολικά αρχεία, μικρές ομάδες σειρών ή ευρεία επανακωδικοποίηση μετά από ενημερώσεις. Συμπυκνώστε μικρά αρχεία, αναθεωρήστε ομάδες γραμμών και εφαρμόστε το V-Order σε πίνακες γραμμένους με Spark. Προαιρετικά, διαμορφώστε την ομαδοποίηση υγρών για να βελτιώσετε την ποιότητα συμπίεσης στα αρχεία Parquet. Διατηρήστε το V-Order ενεργοποιημένο και αξιολογήστε την ομαδοποίηση δεδομένων.
Ανάπτυξη αποθήκευσης αρχείων χωρίς αναφορά Ο χώρος αποθήκευσης OneLake αυξάνεται ταχύτερα από το μέγεθος του ενεργού πίνακα μετά από λειτουργίες αλλαγής δεδομένων. Εκτελέστε VACUUM σύμφωνα με τις απαιτήσεις διατήρησης. Καμία ενέργεια. Η εκκαθάριση γίνεται από το σύστημα.

Για κατοπτρικά δεδομένα, ακολουθήστε την αποκατάσταση ειδικά για την πύλη παραγωγής στην ενότητα Βελτιστοποίηση κατοπτρικών δεδομένων. Ο κατοπτρισμός βάσης δεδομένων διαχειρίζεται το σύστημα. Για καταλόγους κατοπτρισμού, εφαρμόστε υποστηριζόμενη συντήρηση στην πλατφόρμα προέλευσης.

Για τραπέζια lakehouse, οι επιλογές επιθεώρησης που υποστηρίζονται από το Spark περιλαμβάνουν:

  • Εκτελέστε DESCRIBE DETAIL για να επιθεωρήσετε το πλήθος αρχείων, το συνολικό μέγεθος και την αξιολογημένη delta.targetFileSize.adaptive ιδιότητα.
  • Τρέξτε DESCRIBE HISTORY για να ελέγξετε τα μοτίβα εγγραφής και το ιστορικό συντήρησης.
  • Χρησιμοποιήστε το Delta Analyzer όταν χρειάζεστε λεπτομερή ανάλυση ομάδας γραμμών Direct Lake και μοτίβου ενημέρωσης.

Επιθεωρήστε το μέσο μέγεθος αρχείου

Χρησιμοποιείται DESCRIBE DETAIL για τον υπολογισμό του μέσου μεγέθους αρχείου ως αρχική ένδειξη της διάταξης του πίνακα:

details = spark.sql("DESCRIBE DETAIL schema_name.table_name").first()

table_size_gb = details["sizeInBytes"] / (1024**3)
num_files = details["numFiles"]
avg_file_size_mb = (
    details["sizeInBytes"] / num_files / (1024**2)
    if num_files
    else 0
)

print(f"Table size: {table_size_gb:.2f} GB")
print(f"Number of files: {num_files}")
print(f"Average file size: {avg_file_size_mb:.2f} MB")

Ένας μέσος όρος μπορεί να κρύψει τη στρέβλωση μεταξύ κατατμήσεων ή πρόσφατων και προηγουμένως συμπιεσμένων αρχείων. Εάν ο μέσος όρος υποδεικνύει ένα πιθανό πρόβλημα διάταξης, επιθεωρήστε τα μεμονωμένα αρχεία Parquet ή χρησιμοποιήστε το Delta Analyzer για να αξιολογήσετε την κατανομή πριν αλλάξετε τις ρυθμίσεις συντήρησης.

Πότε να δημιουργήσετε έναν άλλο πίνακα

Μην δημιουργείτε έναν άλλο φυσικό πίνακα αποκλειστικά και μόνο επειδή πολλοί μηχανισμοί Fabric καταναλώνουν τα δεδομένα.

Δημιουργήστε έναν άλλο πίνακα όταν έχει ανεξάρτητο σκοπό, όπως:

  • Ένας μετασχηματισμός ή μια συνάθροιση που αλλάζει τον κόκκο ή την επιχειρηματική σημασία των δεδομένων.
  • Διαφορετικές απαιτήσεις ασφάλειας, διατήρησης ή ποιότητας δεδομένων.
  • Μια απαίτηση λανθάνοντος χρόνου ή ανανέωσης που δεν μπορεί να ικανοποιήσει ο κοινόχρηστος πίνακας.
  • Μια διάταξη ειδικά για τον καταναλωτή της οποίας το μετρούμενο όφελος υπερτερεί του κόστους αποθήκευσης, επεξεργασίας, γενεαλογίας και διακυβέρνησης.