Explorer le traitement de données analytiques

Effectué

Le traitement des données analytiques utilise généralement des systèmes en lecture seule (ou principalement en lecture) qui stockent de vastes volumes de données historiques ou d’indicateurs métier. L’analyse peut être basée sur un instantané des données à un moment donné ou une série d’instantanés.

Les détails spécifiques d’un système de traitement analytique peuvent varier entre les solutions, mais une architecture courante pour l’analytique à l’échelle de l’entreprise ressemble à ceci :

Image montrant une architecture de base de données analytique avec les éléments numérotés décrits ci-dessous.

  1. Les données opérationnelles sont extraites, transformées et chargées (ETL) dans un lac de données à des fins d’analyse, ou extraites et chargées en premier avec des transformations appliquées par la suite, un modèle appelé ELT commun dans les lakehouses modernes.

  2. Les données sont chargées dans un schéma de tables, généralement dans un data lakehouse avec des abstractions tabulaires au-dessus de fichiers dans le lac de données, ou dans un entrepôt de données avec un moteur SQL entièrement relationnel.

  3. Les données de l’entrepôt de données peuvent être agrégées et chargées dans un modèle OLAP (Online Analytical Processing), aujourd’hui plus communément appelé modèle sémantique (et historiquement un cube). Les valeurs numériques agrégées (mesures) des tables de faits sont calculées pour les intersections des dimensions des tables de dimension. Par exemple, le total d’un chiffre d’affaires peut être calculé par date, client et produit. Power BI modèles sémantiques sont l'exemple le plus courant que vous rencontrerez.

  4. Les données du modèle de lac de données, d’entrepôt de données et analytique peuvent être interrogées pour produire des rapports, des visualisations et des tableaux de bord.

Les lacs de données sont courants dans les scénarios de traitement analytique de données à grande échelle, où un grand volume de données basées sur des fichiers doit être collecté et analysé.

Les entrepôts de données constituent un moyen établi de stocker des données dans un schéma relationnel optimisé pour les opérations de lecture, principalement des requêtes pour prendre en charge la création de rapports et la visualisation des données.

Data Lakehouses est une innovation plus récente qui combine le stockage flexible et évolutif d’un lac de données avec la sémantique d’interrogation relationnelle d’un entrepôt de données. Le schéma des tables peut nécessiter une certaine dénormalisation des données dans une source de données OLTP (en introduisant une certaine duplication pour accélérer les requêtes).

Un modèle OLAP (ou modèle sémantique) est un type agrégé de stockage de données optimisé pour les charges de travail analytiques. Les agrégations de données sont réparties sur plusieurs dimensions à différents niveaux, ce qui vous permet d’explorer/descendre pour afficher les agrégations à plusieurs niveaux hiérarchiques ; par exemple, pour rechercher le total des ventes par région, par ville ou pour une adresse individuelle. Étant donné que les données sont prédéfinies, les requêtes permettant de retourner les résumés qu’elle contient peuvent être exécutées rapidement.

Les différents types d’utilisateur peuvent effectuer des tâches analytiques de données à différentes étapes de l’architecture globale. Par exemple :

  • Les scientifiques des données peuvent travailler directement avec les fichiers de données d’un lac de données pour explorer et modéliser les données.
  • Les analystes Données peuvent interroger des tables directement dans l’entrepôt de données afin de produire des rapports et des visualisations complexes.
  • Les utilisateurs professionnels peuvent consommer des données prédéfinies dans un modèle analytique sous la forme de rapports ou de tableaux de bord.

Plateformes d’analytique modernes

Azure fournit plusieurs services managés qui couvrent le pipeline d’analytique complète , de l’ingestion de données brutes à des rapports interactifs. Deux plateformes « tout-en-un » regroupent la plupart de ces fonctionnalités dans un espace de travail unique. Microsoft Fabric et Azure Databricks sont ces deux plateformes ; un troisième service, Microsoft Purview, se concentre sur la gouvernance des données sur toutes vos sources. Vous n’avez pas encore besoin d’être familiarisé avec ces services. Les descriptions suivantes vous donnent un aperçu de ce que chacun d’eux fait.

Microsoft Fabric est une plateforme d’analytique SaaS unifiée qui regroupe les fonctionnalités de stockage, d’ingénierie des données, d’entreposage de données et de création de rapports dans un espace de travail unique. Azure Databricks est une plateforme d’analytique dans le cloud conçue pour l’ingénierie des données à grande échelle et la science des données, utilisant Delta Lake — Parquet associé à un journal des transactions permettant la gestion des versions et les transactions ACID — comme format de stockage standard. Microsoft Purview fournit une sécurité, une gouvernance et une conformité unifiées des données, ce qui vous aide à découvrir, classifier, protéger et gérer des données sur toutes vos sources de données.

Diagram montrant les plateformes d’analytique modernes Microsoft Fabric, Azure Databricks et Microsoft Purview.

Organisation des données avec l’architecture en médaillon

Un modèle courant pour l’organisation des données dans un lakehouse est l’architecture de médaillon, qui utilise trois couches :

  • Bronze : données brutes ingérées as-is à partir de systèmes sources, sans transformations appliquées, conservant les enregistrements d’origine pour le retraitement.
  • Silver : données nettoyées et conformes, avec des doublons supprimés et des types de données normalisés.
  • Gold : données agrégées et prêtes pour l’entreprise modélisées pour des cas d’usage spécifiques de création de rapports et d’analytique.

Diagramme montrant une architecture de médaillon.

Teams utilise ce modèle, car il crée des limites de qualité claires à chaque couche, et vous pouvez toujours retraiter les données des enregistrements Bronze d’origine si les exigences changent.

Les deux Fabric et Databricks incluent des expériences Copilot qui vous permettent d’explorer les données à l’aide du langage naturel.