Configuration requise pour les pipelines autonomes

La création et l’actualisation de vues matérialisées autonomes et de tables de streaming nécessitent un espace de travail activé pour le calcul serverless et pour Unity Catalog, ainsi que soit un entrepôt SQL, soit un notebook exécuté sur du calcul serverless à usage général.

Vous pouvez créer et actualiser des vues matérialisées autonomes et des tables de diffusion en continu à l’aide d’un entrepôt SQL. Pour envoyer des instructions CREATE et REFRESH, utilisez l’éditeur SQL dans l’interface utilisateur Azure Databricks, l’interface CLI SQL Databricks SQL CLI ou l’API SQL Databricks SQL API.

Vous pouvez également créer et actualiser des vues matérialisées indépendantes et des tables de flux à partir d’un notebook exécuté sur un calcul sans serveur à usage général (bêta, disponibilité régionale limitée). Voir Notebooks.

Conditions générales

Les exigences suivantes s’appliquent à tous les pipelines autonomes.

Vous devez avoir :

Autorisations de création ou d’actualisation

Le propriétaire (l’utilisateur qui crée la table) doit disposer des autorisations suivantes :

  • SELECT privilège sur les tables de base.
  • les privilèges USE CATALOG et USE SCHEMA sur le catalogue et le schéma contenant les tables sources.
  • privilèges USE CATALOG et USE SCHEMA sur le catalogue cible et le schéma.
  • CREATE MATERIALIZED VIEW privilège sur le schéma contenant la vue matérialisée.
  • privilège CREATE TABLE sur le schéma contenant la table de streaming. Les pipelines utilisant le mode de publication hérité nécessitent également le privilège CREATE TABLE pour les vues matérialisées.

Pour actualiser une vue matérialisée indépendante ou une table de streaming :

  • Vous devez être dans l’espace de travail qui l’a créé.
  • Vous devez disposer du privilège REFRESH sur la table. Les propriétaires ont implicitement ce privilège.

Conditions requises pour la table source

Pour l’actualisation incrémentielle des vues matérialisées à partir de tables Delta, les tables sources doivent avoir activé le suivi des lignes.

Entrepôts de données SQL

Pour créer ou actualiser des vues matérialisées autonomes et des tables de diffusion en continu à l’aide d’un entrepôt SQL, vous devez disposer d’un entrepôt SQL serverless ou pro compatible avec le catalogue Unity.

Notebooks

Vous pouvez créer et actualiser des vues matérialisées indépendantes et des tables de flux à partir d’un notebook à l’aide du calcul serverless à usage général.

Calcul générique serverless

Important

La création et l’actualisation de vues matérialisées autonomes et de tables de streaming à partir d’un notebook sur un calcul serverless à usage général sont en bêta. Cette fonctionnalité est disponible uniquement dans certaines régions. Consultez la disponibilité régionale.

Vous pouvez créer et actualiser des vues matérialisées autonomes et des tables de streaming à partir d’un notebook attaché à des ressources de calcul serverless à usage général. Cette option est utile lorsque vous souhaitez définir et exécuter des vues matérialisées ou des tables de streaming en même temps que d’autres flux de travail basés sur un notebook sans provisionner un entrepôt SQL.

Pour créer et actualiser des vues matérialisées autonomes et des tables de streaming en Python dans un notebook, consultez Utiliser Python avec des pipelines autonomes.

Exigences générales en matière de calcul sans serveur

  • Un notebook connecté à un calcul sans serveur à usage général.
  • Databricks Runtime 18.1 ou version ultérieure. Les notebooks interactifs répondent automatiquement à cette exigence ; les tâches épinglées à une version antérieure n’y répondent pas.
  • Votre espace de travail doit se trouver dans une région prise en charge.

Limitations

  • Seul le propriétaire de la table peut actualiser la table. Pour permettre à un autre utilisateur d’actualiser, modifiez le propriétaire. Consultez Modifier le propriétaire d’une table de diffusion en continu et modifier le propriétaire d’une vue matérialisée.
  • Les actualisations asynchrones ne sont pas prises en charge. Utilisez plutôt une actualisation synchrone.
  • Le canal d’aperçu n’est pas pris en charge. Les tables créées sur le calcul serverless à usage général utilisent le canal current.
  • Une table ne peut être actualisée qu’à l’aide du type de calcul avec lequel elle a été créée. Une table créée dans un entrepôt SQL doit être actualisée dans un entrepôt SQL, et une table créée dans un environnement de calcul général sans serveur doit être actualisée dans un environnement de calcul général sans serveur. Pour vérifier le type de calcul, affichez la table dans l’Explorateur de catalogues.
  • L’attribution et le contrôle des coûts ne sont pas disponibles. Utilisez un entrepôt SQL si vous avez besoin d’une attribution de coût par table.
  • La mise à l’échelle automatique verticale sur les erreurs hors mémoire n’est pas disponible.
  • Les nouvelles tentatives pour les mises à niveau de schéma ne sont pas disponibles.
  • La sélection du mode de performance lors de l’actualisation n’est pas disponible. Consultez Sélectionner un mode de performances pour les actualisations planifiées.

Note

spark.sql est pris en charge lors de l’exécution d’une opération d’actualisation dans un notebook sur un calcul serverless à usage général.

Conditions requises pour les requêtes

Pour interroger une vue matérialisée indépendante ou une table de streaming, vous devez en être le propriétaire, ou disposer de SELECT sur la table ainsi que de USE CATALOG et USE SCHEMA sur les objets parents.

Vous devez utiliser l’une des ressources de calcul suivantes :

  • Entrepôt SQL
  • Interfaces des pipelines Lakeflow
  • Calcul du mode d’accès standard (anciennement mode d’accès partagé)
  • Calcul du mode d’accès dédié (anciennement mode d’accès utilisateur unique) sur Databricks Runtime 15.4 ou version ultérieure, si l’espace de travail est activé pour le calcul serverless. Consultez Contrôle d’accès précis sur le calcul dédié. Si vous êtes le propriétaire, vous pouvez utiliser le calcul en mode d’accès dédié exécutant Databricks Runtime 14.3 ou version ultérieure.

Pour les tables de diffusion en continu sur Databricks Runtime 15.3 et versions ultérieures, vous pouvez utiliser le calcul dédié pour interroger une table de diffusion en continu uniquement si vous le possédez. Databricks Runtime 15.4 LTS et versions ultérieures prennent en charge l’interrogation des tables générées par le pipeline sur le calcul dédié même si vous n’êtes pas le propriétaire. Vous pouvez être facturé pour les ressources de calcul serverless lorsque vous utilisez le calcul dédié pour exécuter des opérations de filtrage des données. Consultez Contrôle d’accès précis sur le calcul dédié.

Disponibilité régionale

Les tables créées et actualisées à l’aide d’un entrepôt Databricks SQL sont disponibles dans toutes les régions qui prennent en charge les entrepôts SQL Databricks serverless.

La création et l’actualisation des vues matérialisées autonomes et des tables de streaming sur le calcul serverless à usage général sont disponibles uniquement dans certaines régions.

Pour obtenir la liste des régions prises en charge pour les deux options de calcul, consultez Disponibilité du mode serverless.