Remarque
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page nécessite une autorisation. Vous pouvez essayer de modifier des répertoires.
Le point d’accès d’analyse SQL est une surface T-SQL optimisée en lecture sur des données Delta dans Fabric. Cet article explique la charge de travail Fabric data warehousing avec le point d’accès SQL analytics du lakehouse, ainsi que les scénarios d’utilisation du lakehouse dans le data warehousing.
Qu’est-ce qu’un point d’accès SQL Analytics Lakehouse ?
Le point d’accès SQL Analytics vous permet d’interroger les données dans le lakehouse en utilisant le langage T-SQL et le protocole TDS.
- Le point d’accès SQL Analytics expose les tables Delta du lakehouse sous forme de tables SQL que vous pouvez interroger avec T-SQL.
- Chaque table Delta provenant d’une maison lacustre est représentée par une seule table. Les données doivent être au format delta.
- Chaque maison de bord dispose d’un point de terminaison d’analyse SQL, et chaque espace de travail peut avoir plus d’un château de lac. D’autres éléments Fabric – y compris les entrepôts, les bases de données miroirs, les bases de données SQL et Azure Cosmos DB – fournissent également automatiquement un point d’accès d’analyse SQL, permettant ainsi à un espace de travail d’avoir plus de points d’accès d’analyse SQL que d’éléments de type lakehouse.
Vous n'avez pas besoin de créer un point d'accès d'analyse SQL dans Fabric. Un point de terminaison d’analytique SQL est automatiquement créé pour chaque lakehouse, base de données ou base de données en miroir. Un point de terminaison SQL analytique sert de capacité légère d’entrepôt de données pour leurs éléments parents, venant compléter l’architecture lakehouse de l’entrepôt. Cette architecture permet à Spark ou à la mise en miroir dans Fabric de gérer les données dans une structure de dossiers du lakehouse que le point de terminaison d’analytique SQL peut consulter.
Note
En arrière-plan, le point de terminaison d’analyse SQL utilise le même moteur que l’entrepôt pour traiter des requêtes SQL hautes performances et à faible latence.
Découverte automatique des métadonnées
Un processus transparent lit les journaux Delta à partir du /Tables dossier et garantit que les métadonnées SQL pour les tables, telles que les statistiques, sont toujours à jour. Aucune action de l’utilisateur n’est nécessaire et il n’est pas nécessaire d’importer, de copier des données ou de configurer l’infrastructure. Pour plus d’informations, consultez Schéma généré automatiquement dans le point de terminaison d’analytique SQL.
Scénarios que permet la maison lacustre pour l’entreposage de données
Dans Fabric, nous proposons un seul entrepôt.
Le lakehouse, avec son endpoint d’analyse SQL propulsé par l’entrepôt, peut simplifier l’arbre de décision traditionnel des patterns d’architecture batch, streaming ou lambda. Avec un entrepôt, l'entrepôt-lac permet de nombreux scénarios d'analytique additive. Cette section explore comment utiliser une cabane lacustre avec un entrepôt pour une stratégie d’analyse de meilleure qualité.
Analyses avec la couche d’or de votre maison lacustre
Une stratégie connue pour l’organisation des données de lac est une architecture de médaillon. Cette stratégie organise les fichiers en couches brutes (bronze), consolidées (argent) et affinées (or). Vous pouvez utiliser un point de terminaison d'analytique SQL pour analyser les données dans la couche d'or de l'architecture de médaillon si les fichiers sont stockés au format Delta Lake, même s'ils sont stockés en dehors du Microsoft Fabric OneLake.
Utilisez des raccourcis dans OneLake pour référencer les dossiers gold dans les comptes de stockage externes Azure Data Lake que gèrent les moteurs Azure Synapse Spark ou Azure Databricks.
Vous pouvez également ajouter des entrepôts de données comme solutions orientées par domaine métier ou par sujet pour des domaines métier spécifiques pouvant avoir des exigences analytiques sur mesure.
Si vous choisissez de conserver vos données dans Fabric, elles sont toujours ouvertes et accessibles via des API, le format Delta et, bien sûr, T-SQL.
Requête en tant que service sur vos tables Delta de Lakehouse et d’autres articles de OneLake
Les analystes, les scientifiques des données et les ingénieurs données peuvent avoir besoin d’interroger des données dans un lac de données. Dans Fabric, cette expérience de bout en bout est entièrement SaaSified.
OneLake est un lac de données unique, unifié et logique pour l'ensemble de l'organisation. OneLake est OneDrive pour les données. OneLake peut contenir plusieurs espaces de travail, par exemple, le long de vos divisions organisationnelles. Chaque élément de Fabric rend les données accessibles via OneLake.
Les données dans une maison lacustre dans Fabric sont physiquement stockées dans OneLake avec la structure de dossiers suivante :
- Le
/Filesdossier contient des fichiers bruts et non consolidés (bronze) que les ingénieurs données doivent traiter avant l’analyse. Les fichiers peuvent se trouver dans différents formats tels que CSV, Parquet, différents types d’images, etc. - Le
/Tablesdossier contient des données affinées et consolidées (gold), prêtes à être utilisées pour l’analyse métier. Les données consolidées sont au format Delta Lake.
Un point de terminaison d’analytique SQL peut lire des données dans le dossier /tables au sein de OneLake. L’analyse est aussi simple que d’interroger le point d’accès SQL Analytics de la maison du lac. Avec l’entrepôt, vous bénéficiez également de requêtes inter-bases de données et de la possibilité de passer sans effort des requêtes en lecture seule à la construction de logique métier supplémentaire par-dessus vos données OneLake avec Fabric Data Warehouse.
Ingénieurs de données avec Spark et service avec SQL
Les entreprises pilotées par les données doivent assurer la synchronisation en quasi-temps réel de leurs systèmes de back-end et d’analytique avec les applications orientées clients. L’impact des transactions doit être reflété avec précision dans les processus de bout en bout, les applications associées et les systèmes OLTP (Online Transaction Processing).
Dans Fabric, vous pouvez utiliser Spark Streaming ou l'ingénierie des données pour gérer vos données. Vous pouvez utiliser le point de terminaison d’analyse SQL Lakehouse pour valider la qualité des données et pour les processus T-SQL existants. Cela peut se faire dans une architecture médaillon ou dans plusieurs couches de votre maison lacustre, en fournissant des données en bronze, argent, or ou de mise en scène, sélectionnées et raffinées. Vous pouvez personnaliser les dossiers et les tables créés via Spark pour répondre à vos besoins métier et d’ingénierie des données. Une fois prêt, un entrepôt peut servir toutes vos applications d’intelligence économique en aval et autres cas d’utilisation analytiques, sans copier les données, utiliser des vues ou affiner les données via CREATE TABLE AS SELECT (CTAS), procédures stockées et autres commandes DML / DDL.
Intégration avec la couche d’or de votre maison ouverte au lac
Un endpoint d'analyse SQL ne se limite pas à l'analyse de données dans le seul laquais de Fabric. En utilisant un point d’accès d’analyse SQL, vous pouvez analyser les données lacustres dans n’importe quelle maison lacustre en utilisant Azure Synapse Spark, Azure Databricks ou tout autre moteur d’ingénierie des données centré sur les lacs. Vous pouvez stocker les données dans Azure Data Lake Storage ou Amazon S3.
Vous pouvez toujours accéder à cette intégration étroite et bidirectionnelle avec le lakehouse dans Fabric via n’importe quel moteur en utilisant des API ouvertes, le format Delta, et bien sûr T-SQL.
Virtualisation des données des lacs de données externes avec des raccourcis
Utilisez les raccourcis OneLake pour référencer les dossiers gold dans les comptes de stockage externes Azure Data Lake que gèrent les moteurs Azure Synapse Spark ou Azure Databricks, ainsi que toute table Delta stockée dans Amazon S3.
Vous pouvez analyser n’importe quel dossier référencé par un raccourci à partir d’un point de terminaison d’analyse SQL et créer une table SQL pour les données référencées. Utilisez la table SQL pour exposer des données dans des lacs de données gérés en externe et activer l’analytique sur celles-ci.
Ce raccourci sert d’entrepôt virtuel que vous pouvez exploiter depuis un entrepôt pour répondre à des besoins d’analyses en aval supplémentaires, ou l’interroger directement.
Pour analyser des données dans des comptes de stockage data lake externes, procédez comme suit :
- Créez un raccourci qui référence un dossier dans Azure Data Lake Storage ou un compte Amazon S3. Après avoir saisi les informations de connexion et les identifiants, un raccourci s’affiche dans la maison du lac.
- Passez au point d’accès SQL Analytics du lakehouse et trouvez une table SQL dont le nom correspond au nom du raccourci. Cette table SQL fait référence au dossier dans ADLS ou S3.
- Interrogez la table SQL qui référence des données dans ADLS ou S3. Utilisez la table comme vous le feriez pour n’importe quelle autre table dans le point de terminaison d’analyse SQL. Vous pouvez joindre des tables qui référencent des données dans différents comptes de stockage.
Note
Si la table SQL ne s’affiche pas immédiatement dans le point de terminaison d’analyse SQL, patientez quelques minutes. La table SQL qui référence des données dans le compte de stockage externe est créée avec un délai.
Analyser les données archivées ou historiques dans un lac de données
Le partitionnement des données est une technique bien connue d’optimisation de l’accès aux données dans les lacs de données. Stockez des jeux de données partitionnés dans des structures de dossiers hiérarchiques au format /year=<year>/month=<month>/day=<day>, où yearmonth, et day sont les colonnes de partitionnement. Cette structure conserve les données historiques séparées logiquement et permet aux moteurs de calcul de lire les données selon les besoins avec un filtrage performant, plutôt que de lire l’intégralité du répertoire et tous les dossiers et fichiers au sein.
Les données partitionnées permettent un accès plus rapide lorsque les requêtes appliquent un filtre sur des prédicats qui comparent les colonnes de prédicat à une valeur.
Un point de terminaison d’analytique SQL peut facilement lire ce type de données sans nécessiter de configuration. Par exemple, vous pouvez utiliser n’importe quelle application pour archiver des données dans un lac de données, notamment SQL Server 2022 ou Azure SQL Managed Instance. Après avoir partitionné des données et les avoir stockées dans un lac de données à des fins d’archivage à l’aide de tables externes, un point de terminaison d’analytique SQL peut lire les tables Delta Lake partitionnées comme des tables SQL et permettre à votre organisation de les analyser. Cette approche réduit le coût total de possession, réduit la duplication des données et éclaire les big data, l’IA et d’autres scénarios d’analytique.
Vous pouvez également utiliser des requêtes de voyage temporel pour interroger rapidement les versions antérieures des données. Le voyage dans le temps est une fonctionnalité économique et efficace pour interroger les états passés des données avec des requêtes T-SQL. Pour un endpoint d’analyse SQL Lakehouse, le déplacement dans le temps est limité par les paramètres de rétention du vide. Pour commencer, consultez Procédure : interroger des données à l’aide du voyage dans le temps au niveau de l’instruction.
Virtualisation des données Fabric avec des raccourcis
Dans Fabric, les espaces de travail vous permettent de séparer les données en fonction des exigences métier, géographiques ou réglementaires complexes.
Un point d’accès d’analyse SQL vous permet de laisser les données en place tout en les analysant dans l’entrepôt ou le lac, même dans d’autres espaces de travail Fabric, via une virtualisation fluide. Chaque maison lacustre de Fabric stocke les données dans OneLake.
Les raccourcis vous permettent de référencer des dossiers dans n’importe quel emplacement OneLake.
Chaque entrepôt dans Fabric stocke les données de tables dans OneLake. Si une table est uniquement en ajout, les données de la table sont exposées en tant que données Delta Lake dans OneLake. Les raccourcis vous permettent de consulter des dossiers dans n’importe quel OneLake où les tables d’entrepôt sont exposées.
Partage et requêtes entre espaces de travail
Bien que les espaces de travail vous permettent de séparer les données en fonction d’exigences métier, géographiques ou réglementaires complexes, vous devez parfois faciliter le partage entre ces lignes pour des besoins d’analyse spécifiques.
Un point d’accès SQL Lakehouse peut permettre un partage facile des données entre départements et utilisateurs, où un utilisateur peut apporter sa propre capacité et entrepôt. Les espaces de travail organisent des services, des unités commerciales ou des domaines analytiques. En utilisant des raccourcis, les utilisateurs peuvent trouver les données de n’importe quel entrepôt ou maison lacustre. Les utilisateurs peuvent effectuer instantanément leurs propres analyses personnalisées à partir des mêmes données partagées. En plus de faciliter les rétrofacturations entre services et la répartition de l’utilisation, cette approche constitue une version sans copie des données.
Le point de terminaison d’analytique SQL permet d’interroger n’importe quelle table et d’en faciliter le partage. Vous pouvez ajouter des contrôles à l’aide de rôles d’espace de travail et de rôles de sécurité pour répondre à des exigences métier supplémentaires.
Pour activer l’analytique des données inter-espaces de travail, procédez comme suit :
- Créez un raccourci OneLake qui référence une table ou un dossier dans un espace de travail auquel vous pouvez accéder.
- Choisissez une maison lacustre ou un entrepôt qui contient une table ou un dossier Delta Lake que vous souhaitez analyser. Lorsque vous sélectionnez un tableau ou un dossier, un raccourci apparaît dans la maison du lac.
- Passez au point d’accès SQL Analytics du lakehouse et trouvez la table SQL dont le nom correspond au nom du raccourci. Cette table SQL fait référence au dossier d’un autre espace de travail.
- Interrogez la table SQL qui référence des données dans un autre espace de travail. Vous pouvez utiliser la table comme vous le feriez pour n’importe quelle autre table dans le point de terminaison d’analyse SQL. Vous pouvez joindre les tables qui référencent des données dans différents espaces de travail.
Pour plus d’informations sur la sécurité dans le point de terminaison d’analytique SQL, consultez La sécurité OneLake pour les points de terminaison d’analytique SQL.
Note
Si la table SQL n’apparaît pas immédiatement dans le point de terminaison d’analyse SQL, patientez quelques minutes. La table SQL qui référence des données dans un autre espace de travail est créée avec un délai.
Analyser les données partitionnées
Le partitionnement des données est une technique bien connue d’optimisation de l’accès aux données dans les lacs de données. Vous stockez des jeux de données partitionnés dans des structures de dossiers hiérarchiques au format /year=<year>/month=<month>/day=<day>, où yearmonth, et day sont les colonnes de partitionnement. Les jeux de données partitionnés permettent un accès plus rapide aux données si les requêtes utilisent des prédicats qui filtrent les données en comparant les colonnes de prédicat à une valeur.
Un point de terminaison d’analytique SQL peut représenter des jeux de données Delta Lake partitionnés sous forme de tables SQL afin de vous permettre de les analyser.
Pour plus d'informations et d'exemples sur l'interrogation de données externes, consultez l'utilisation de Fabric Data Warehouse ou du point de terminaison SQL Analytics pour interroger des fichiers de lac de données externes. Pour obtenir un exemple et un cas d’usage pour interroger des fichiers Parquet partitionnés, consultez Interroger les données partitionnées.
Analysez les données dans la maison du lac, l’entrepôt ou la salle d’événements
Les pages principales de Lakehouse et de Warehouse incluent le point de terminaison Eventhouse dans le cadre du menu Analyser les données. L'interface Eventhouse propose une expérience de requête optimisée par Eventhouse directement sur les données du Lakehouse et de l'entrepôt, sans duplication ni synchronisation manuelle.
Lorsque vous activez le point de terminaison Eventhouse, une base de données Eventhouse et KQL sont automatiquement créées en tant qu’éléments enfants de la source Lakehouse ou Warehouse, avec la synchronisation de schéma gérée en arrière-plan. Le point de terminaison reflète toujours le schéma actuel des données sources, ce qui permet l’accès analytique en temps quasi réel.
Cette intégration rend Eventhouse une extension naturelle de la source de données, plutôt qu’un système distinct que vous devez configurer et gérer. Pour plus d’informations sur le point de terminaison Eventhouse, consultez Activer le point de terminaison Eventhouse pour lakehouse et warehouse.
Contenu connexe
- Qu’est-ce qu’un lakehouse dans Fabric ?
- Guide de choix Fabric : Choisissez entre entrepôt et maison lacustre
- Apportez vos données à OneLake avec Lakehouse
- Modèles sémantiques Power BI dans Fabric
- Options pour transférer des données dans la maison du lac à Fabric
- Comment copier des données à l’aide de l’activité de copie
- Transférer les données d’Azure SQL DB vers lakehouse via copy assistant
- Connectivité à l’entreposage de données dans Fabric
- Point de terminaison d'analyse SQL du Lakehouse
- Interroger le point de terminaison ou l’entrepôt d’analytique SQL dans Fabric