Delta Lake Επισκόπηση

Το Microsoft Fabric χρησιμοποιεί το Delta Lake ως καθολική μορφή αποθήκευσης σε όλους τους φόρτους εργασίας. Είτε δημιουργείτε αποθήκες δεδομένων, δημιουργείτε lakehouses, ενορχηστρώνετε διοχετεύσεις ή αναλύετε δεδομένα με το Power BI, τα δεδομένα σας αποθηκεύονται σε μορφή Delta Lake στο OneLake.

Για τα περισσότερα σενάρια, το Delta Lake λειτουργεί με διαφάνεια στο παρασκήνιο—δεν χρειάζεται να το κατανοήσετε για να χρησιμοποιήσετε αποτελεσματικά το Fabric. Ωστόσο, όταν βελτιστοποιείτε την απόδοση, ενσωματώνεστε με εξωτερικά συστήματα ή αντιμετωπίζετε σενάρια πολλαπλού φόρτου εργασίας, η κατανόηση του Delta Lake σάς βοηθά να εργάζεστε πιο αποτελεσματικά.

Τι είναι το Delta Lake;

Το Delta Lake είναι ένα επίπεδο αποθήκευσης ανοιχτού κώδικα που προσφέρει αξιοπιστία και απόδοση στις λίμνες δεδομένων. Στον πυρήνα της, η λίμνη Delta συνδυάζει δύο στοιχεία:

  • Αρχεία παρκέ — Μια αποτελεσματική μορφή αποθήκευσης στηλών για αναλυτικά στοιχεία.
  • Αρχείο καταγραφής συναλλαγών — Μια καταγραφή όλων των αλλαγών στα δεδομένα που επιτρέπει τις εγγυήσεις ACID.

Αυτός ο συνδυασμός παρέχει δυνατότητες που δεν μπορεί να προσφέρει ο παραδοσιακός χώρος αποθήκευσης που βασίζεται σε αρχεία:

  • Συναλλαγές ACID: Οι ατομικές, συνεπείς, απομονωμένες και ανθεκτικές λειτουργίες διασφαλίζουν την ακεραιότητα των δεδομένων ακόμη και όταν πολλές διεργασίες διαβάζουν και γράφουν ταυτόχρονα
  • Χρονική μετακίνηση: Υποβολή ερωτημάτων για δεδομένα όπως υπήρχαν σε οποιαδήποτε χρονική στιγμή, επαναφορά σφαλμάτων ή έλεγχος αλλαγών ιστορικού
  • Εξέλιξη σχήματος: Προσθήκη, κατάργηση ή τροποποίηση στηλών χωρίς επανεγγραφή υπαρχόντων δεδομένων
  • Ενοποιημένη παρτίδα και ροή: Επεξεργαστείτε δεδομένα σε πραγματικό χρόνο και παρτίδα χρησιμοποιώντας την ίδια μορφή πίνακα

Το Delta Lake διατηρείται ως έργο Linux Foundation με ανοιχτές προδιαγραφές, πράγμα που σημαίνει ότι λειτουργεί σε όλες τις πλατφόρμες—Databricks, Azure Synapse Analytics, AWS και περιβάλλοντα ανοιχτού κώδικα Apache Spark υποστηρίζουν όλα πίνακες Delta Lake.

Γιατί το Fabric χρησιμοποιεί τη λίμνη Delta

Το Microsoft Fabric επέλεξε το Delta Lake ως καθολική μορφή για να λύσει μια θεμελιώδη πρόκληση: να επιτρέψει σε όλους τους φόρτους εργασίας να μοιράζονται δεδομένα χωρίς διπλότυπα ή πολύπλοκες διαδικασίες ETL.

OneLake + Delta Lake = ενιαία πηγή αλήθειας

Το OneLake αποθηκεύει όλα τα δεδομένα ως Delta Parquet από προεπιλογή. Αυτή η αρχιτεκτονική απόφαση σημαίνει:

  • Χωρίς σιλό δεδομένων: Μια βάση δεδομένων lakehouse, αποθήκη και KQL μπορούν να διαβάσουν από τον ίδιο πίνακα Delta
  • Δεν υπάρχει ETL μεταξύ των φόρτων εργασίας: Τα δεδομένα που γράφονται από έναν κινητήρα είναι άμεσα αναγνώσιμα από άλλους
  • Ένα αντίγραφο δεδομένων: Ο οργανισμός σας διατηρεί μια ενιαία έκδοση της αλήθειας, μειώνοντας το κόστος αποθήκευσης και εξαλείφοντας τα προβλήματα συγχρονισμού δεδομένων

Βελτιστοποίηση απόδοσης βασισμένη στο Delta

Το Fabric επεκτείνει τη λίμνη Delta με χαρακτηριστικά απόδοσης σχεδιασμένα για την πλατφόρμα:

  • V-Order: Βελτιστοποίηση εγγραφής ειδικά για Fabric που αναδιοργανώνει τα δεδομένα για ταχύτερη απόδοση ερωτημάτων σε όλους τους μηχανισμούς
  • Αυτόματη συντήρηση πίνακα: Fabric μπορεί να συμπυκνώσει αυτόματα μικρά αρχεία και να καθαρίσει παλιά δεδομένα
  • Ενοποίηση με υπηρεσίες Fabric: Οι πίνακες Delta λειτουργούν απρόσκοπτα με Power BI Direct Lake, τελικά σημεία ανάλυσης SQL, διοχετεύσεις και σημειωματάρια

Αυτός ο συνδυασμός ανοιχτών προτύπων και βελτιστοποιήσεων Fabric σάς προσφέρει φορητότητα και απόδοση.

Κατανοώντας το ταξίδι σας στη λίμνη Δέλτα

Πόσα πρέπει να γνωρίζετε για το Delta Lake εξαρτάται από το τι κάνετε στο Fabric:

Το Delta Lake είναι διαφανές για τους περισσότερους χρήστες

Εάν εργάζεστε με αυτά τα σενάρια, το Fabric χειρίζεται αυτόματα το Delta Lake:

  • Υποβολή ερωτημάτων δεδομένων με SQL: Τα τελικά σημεία ανάλυσης SQL και οι αποθήκες δεδομένων αφαιρούν το Delta πίσω από μια διεπαφή SQL—ρωτάτε πίνακες χρησιμοποιώντας T-SQL χωρίς να σκέφτεστε τις μορφές αρχείων
  • Δημιουργία αναφορών σε Power BI: Το Power BI Direct Lake διαβάζει απρόσκοπτα τους πίνακες Delta για να παρέχει αναλυτικά στοιχεία σε πραγματικό χρόνο
  • Φόρτωση δεδομένων με διοχετεύσεις: Η δραστηριότητα αντιγραφής εργοστασιακών δεδομένων εγγράφεται σε μορφή Delta από προεπιλογή κατά τη στόχευση πινάκων lakehouse

Για αυτές τις εμπειρίες, το Delta Lake είναι μια λεπτομέρεια υλοποίησης που δεν χρειάζεται να διαχειριστείτε.

Επωφελείστε από την κατανόηση της Delta όταν

Ορισμένα σενάρια απαιτούν γνώση των χαρακτηριστικών της λίμνης Delta:

  • Βελτιστοποίηση της απόδοσης ερωτημάτων: Η κατανόηση των στρατηγικών V-Order, συμπίεσης πίνακα και κατάτμησης σάς βοηθά να συντονίσετε πίνακες για ταχύτερα ερωτήματα
  • Ενσωμάτωση με εξωτερικούς πίνακες Delta: Η σύνδεση σε πίνακες Delta σε Databricks, Snowflake, Amazon S3 ή άλλες πλατφόρμες απαιτεί γνώση της συμβατότητας χαρακτηριστικών
  • Χρήση προηγμένων δυνατοτήτων Spark: Τα διανύσματα διαγραφής, η αντιστοίχιση στηλών, η διεύρυνση τύπων και η ομαδοποίηση υγρών παρέχουν ισχυρές δυνατότητες, αλλά χρειάζονται ρητή ρύθμιση παραμέτρων
  • Αντιμετώπιση προβλημάτων σεναρίων πολλαπλού φόρτου εργασίας: Όταν τα δεδομένα που έχουν συνταχθεί από έναν μηχανισμό δεν συμπεριφέρονται όπως αναμένεται σε έναν άλλο, η κατανόηση της υποστήριξης δυνατοτήτων Delta σάς βοηθά να διαγνώσετε προβλήματα

Επιλογή της μαθησιακής διαδρομής σας

Το σημείο εισόδου σας στην τεκμηρίωση του Delta Lake εξαρτάται από τον ρόλο σας:

Οι μηχανικοί δεδομένων και οι προγραμματιστές του Spark θα πρέπει να ξεκινήσουν με πίνακες Lakehouse και Delta Lake για ολοκληρωμένη κάλυψη του Delta σε περιβάλλοντα Spark, συμπεριλαμβανομένων μοτίβων βελτιστοποίησης, συντήρησης πινάκων και διαμορφώσεων χρόνου εκτέλεσης.

Οι χρήστες SQL και οι προγραμματιστές data warehouse θα πρέπει να εξερευνήσουν την αρχιτεκτονική αποθήκη δεδομένων για να κατανοήσουν πώς η Delta τροφοδοτεί τις δυνατότητες της αποθήκης όπως το ταξίδι στο χρόνο, οι κλώνοι και η συμμόρφωση με το ACID.

Οι προγραμματιστές διοχέτευσης και ενοποίησης δεδομένων θα πρέπει να εξετάσουν τη σύνδεση Lakehouse στο Data Factory για να μάθουν πώς οι διοχετεύσεις γράφουν πίνακες Delta και χειρίζονται την αντιστοίχιση στηλών.

Οποιοσδήποτε εργάζεται σε φόρτους εργασίας θα πρέπει να ανατρέξει στη διαλειτουργικότητα μορφής πίνακα Delta Lake για τον έγκυρο πίνακα υποστήριξης χαρακτηριστικών που δείχνει ποιες δυνατότητες Delta λειτουργούν σε κάθε Fabric εμπειρία.

Βελτιστοποίηση και συντήρηση πίνακα

Ενώ το Fabric χειρίζεται αυτόματα πολλές εργασίες βελτιστοποίησης, μπορείτε να βελτιώσετε τις επιδόσεις για συγκεκριμένα σενάρια:

  • Βελτιστοποίηση V-Order: Γράψτε δεδομένα με ενεργοποιημένο το V-Order για να βελτιώσετε την απόδοση ανάγνωσης σε όλους τους μηχανισμούς ερωτημάτων
  • Συμπίεση πίνακα: Συνδυάστε μικρά αρχεία σε μεγαλύτερα χρησιμοποιώντας εντολές OPTIMIZE για να μειώσετε την επιβάρυνση των ερωτημάτων
  • Z-ordering: Οργανώστε τα δεδομένα κατά στήλες που φιλτράρονται συχνά για να επιταχύνετε τα επιλεκτικά ερωτήματα
  • Λειτουργίες κενού: Καταργήστε παλιές εκδόσεις αρχείων για να μειώσετε το κόστος αποθήκευσης

Για λεπτομερείς οδηγίες σχετικά με το πότε και πώς να χρησιμοποιήσετε αυτές τις τεχνικές σε διαφορετικούς φόρτους εργασίας, ανατρέξτε στην ενότητα Συντήρηση και βελτιστοποίηση πίνακα.

Λίμνη Δέλτα και εξωτερικά συστήματα

Η ανοιχτή προδιαγραφή της Delta Lake επιτρέπει την ενοποίηση με συστήματα εκτός του Fabric:

  • Συντομεύσεις OneLake: Αναφορά πινάκων Delta που είναι αποθηκευμένοι στο Amazon S3, Azure Data Lake Storage ή Databricks χωρίς αντιγραφή δεδομένων
  • Κοινή χρήση Delta: Κοινή χρήση πινάκων Delta σε οργανισμούς χρησιμοποιώντας το ανοιχτό πρωτόκολλο κοινής χρήσης Delta
  • Συμβατότητα μεταξύ πλατφορμών: Οι πίνακες που δημιουργούνται σε Databricks ή Azure Synapse μπορούν να διαβαστούν σε Fabric, με την επιφύλαξη περιορισμών υποστήριξης χαρακτηριστικών

Κατά την ενσωμάτωση εξωτερικών πινάκων Delta, συμβουλευτείτε τον πίνακα διαλειτουργικότητας feature για να κατανοήσετε ποιες δυνατότητες Delta Lake υποστηρίζονται από κάθε εμπειρία Fabric.