Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
La création et l’actualisation de vues matérialisées autonomes et de tables de streaming nécessitent un espace de travail activé pour le calcul serverless et pour Unity Catalog, ainsi que soit un entrepôt SQL, soit un notebook exécuté sur du calcul serverless à usage général.
Vous pouvez créer et actualiser des vues matérialisées autonomes et des tables de diffusion en continu à l’aide d’un entrepôt SQL. Pour envoyer des instructions CREATE et REFRESH, utilisez l’éditeur SQL dans l’interface utilisateur Azure Databricks, l’interface CLI SQL Databricks SQL CLI ou l’API SQL Databricks SQL API.
Vous pouvez également créer et actualiser des vues matérialisées indépendantes et des tables de flux à partir d’un notebook exécuté sur un calcul sans serveur à usage général (bêta, disponibilité régionale limitée). Voir Notebooks.
Conditions générales
Les exigences suivantes s’appliquent à tous les pipelines autonomes.
Vous devez avoir :
- Un compte Azure Databricks avec le mode sans serveur activé. Consultez Configurer des entrepôts SQL serverless.
- Un espace de travail avec Unity Catalog activé. Consultez Bien démarrer avec Unity Catalog.
Autorisations de création ou d’actualisation
Le propriétaire (l’utilisateur qui crée la table) doit disposer des autorisations suivantes :
-
SELECTprivilège sur les tables de base. - les privilèges
USE CATALOGetUSE SCHEMAsur le catalogue et le schéma contenant les tables sources. - privilèges
USE CATALOGetUSE SCHEMAsur le catalogue cible et le schéma. -
CREATE MATERIALIZED VIEWprivilège sur le schéma contenant la vue matérialisée. - privilège
CREATE TABLEsur le schéma contenant la table de streaming. Les pipelines utilisant le mode de publication hérité nécessitent également le privilègeCREATE TABLEpour les vues matérialisées.
Pour actualiser une vue matérialisée indépendante ou une table de streaming :
- Vous devez être dans l’espace de travail qui l’a créé.
- Vous devez disposer du privilège
REFRESHsur la table. Les propriétaires ont implicitement ce privilège.
Conditions requises pour la table source
Pour l’actualisation incrémentielle des vues matérialisées à partir de tables Delta, les tables sources doivent avoir activé le suivi des lignes.
Entrepôts de données SQL
Pour créer ou actualiser des vues matérialisées autonomes et des tables de diffusion en continu à l’aide d’un entrepôt SQL, vous devez disposer d’un entrepôt SQL serverless ou pro compatible avec le catalogue Unity.
- Votre espace de travail doit se trouver dans une région qui prend en charge les entrepôts SQL serverless.
Notebooks
Vous pouvez créer et actualiser des vues matérialisées indépendantes et des tables de flux à partir d’un notebook à l’aide du calcul serverless à usage général.
Calcul générique serverless
Important
La création et l’actualisation de vues matérialisées autonomes et de tables de streaming à partir d’un notebook sur un calcul serverless à usage général sont en bêta. Cette fonctionnalité est disponible uniquement dans certaines régions. Consultez la disponibilité régionale.
Vous pouvez créer et actualiser des vues matérialisées autonomes et des tables de streaming à partir d’un notebook attaché à des ressources de calcul serverless à usage général. Cette option est utile lorsque vous souhaitez définir et exécuter des vues matérialisées ou des tables de streaming en même temps que d’autres flux de travail basés sur un notebook sans provisionner un entrepôt SQL.
Pour créer et actualiser des vues matérialisées autonomes et des tables de streaming en Python dans un notebook, consultez Utiliser Python avec des pipelines autonomes.
Exigences générales en matière de calcul sans serveur
- Un notebook connecté à un calcul sans serveur à usage général.
- Databricks Runtime 18.1 ou version ultérieure. Les notebooks interactifs répondent automatiquement à cette exigence ; les tâches épinglées à une version antérieure n’y répondent pas.
- Votre espace de travail doit se trouver dans une région prise en charge.
Limitations
- Seul le propriétaire de la table peut actualiser la table. Pour permettre à un autre utilisateur d’actualiser, modifiez le propriétaire. Consultez Modifier le propriétaire d’une table de diffusion en continu et modifier le propriétaire d’une vue matérialisée.
- Les actualisations asynchrones ne sont pas prises en charge. Utilisez plutôt une actualisation synchrone.
- Le canal d’aperçu n’est pas pris en charge. Les tables créées sur le calcul serverless à usage général utilisent le canal
current. - Une table ne peut être actualisée qu’à l’aide du type de calcul avec lequel elle a été créée. Une table créée dans un entrepôt SQL doit être actualisée dans un entrepôt SQL, et une table créée dans un environnement de calcul général sans serveur doit être actualisée dans un environnement de calcul général sans serveur. Pour vérifier le type de calcul, affichez la table dans l’Explorateur de catalogues.
- L’attribution et le contrôle des coûts ne sont pas disponibles. Utilisez un entrepôt SQL si vous avez besoin d’une attribution de coût par table.
- La mise à l’échelle automatique verticale sur les erreurs hors mémoire n’est pas disponible.
- Les nouvelles tentatives pour les mises à niveau de schéma ne sont pas disponibles.
- La sélection du mode de performance lors de l’actualisation n’est pas disponible. Consultez Sélectionner un mode de performances pour les actualisations planifiées.
Note
spark.sql est pris en charge lors de l’exécution d’une opération d’actualisation dans un notebook sur un calcul serverless à usage général.
Conditions requises pour les requêtes
Pour interroger une vue matérialisée indépendante ou une table de streaming, vous devez en être le propriétaire, ou disposer de SELECT sur la table ainsi que de USE CATALOG et USE SCHEMA sur les objets parents.
Vous devez utiliser l’une des ressources de calcul suivantes :
- Entrepôt SQL
- Interfaces des pipelines Lakeflow
- Calcul du mode d’accès standard (anciennement mode d’accès partagé)
- Calcul du mode d’accès dédié (anciennement mode d’accès utilisateur unique) sur Databricks Runtime 15.4 ou version ultérieure, si l’espace de travail est activé pour le calcul serverless. Consultez Contrôle d’accès précis sur le calcul dédié. Si vous êtes le propriétaire, vous pouvez utiliser le calcul en mode d’accès dédié exécutant Databricks Runtime 14.3 ou version ultérieure.
Pour les tables de diffusion en continu sur Databricks Runtime 15.3 et versions ultérieures, vous pouvez utiliser le calcul dédié pour interroger une table de diffusion en continu uniquement si vous le possédez. Databricks Runtime 15.4 LTS et versions ultérieures prennent en charge l’interrogation des tables générées par le pipeline sur le calcul dédié même si vous n’êtes pas le propriétaire. Vous pouvez être facturé pour les ressources de calcul serverless lorsque vous utilisez le calcul dédié pour exécuter des opérations de filtrage des données. Consultez Contrôle d’accès précis sur le calcul dédié.
Disponibilité régionale
Les tables créées et actualisées à l’aide d’un entrepôt Databricks SQL sont disponibles dans toutes les régions qui prennent en charge les entrepôts SQL Databricks serverless.
La création et l’actualisation des vues matérialisées autonomes et des tables de streaming sur le calcul serverless à usage général sont disponibles uniquement dans certaines régions.
Pour obtenir la liste des régions prises en charge pour les deux options de calcul, consultez Disponibilité du mode serverless.