Informations de référence sur les propriétés du pipeline

Référence pour les paramètres de configuration json du pipeline et les propriétés de table. Pour plus d’informations sur l’utilisation de ces propriétés et configurations, consultez les articles suivants :

Configuration des pipelines Lakeflow et pipelines déclaratifs Apache Spark™

Les pipelines Lakeflow sont basés sur des pipelines déclaratifs Apache Spark™ (SDP). La configuration du pipeline est en grande partie un super-ensemble de la spécification du projet SDP. Les différences d’utilisation des propriétés entre les pipelines SDP et Lakeflow sont notées. Pour une comparaison des fonctionnalités que les pipelines Lakeflow et le partage SDP partagent, consultez Pipelines déclaratifs Apache Spark.

Configurations de pipeline

  • id

    Entrez : string

    Identificateur global unique (GUID) pour ce pipeline. L’identificateur est attribué par le système et ne peut pas être modifié.

    Pipelines Lakeflow uniquement. SDP n’affecte pas d’identificateur de pipeline

  • name

    Entrez : string

    Nom convivial pour ce pipeline. Le nom peut servir à identifier les travaux du pipeline dans l’interface utilisateur.

    Disponible dans SDP en tant que champ requis name

  • configuration

    Entrez : object

    Liste facultative des paramètres à ajouter à la configuration Spark du cluster qui exécute le pipeline. Ces paramètres sont lus par le runtime du pipeline et disponibles pour les requêtes de pipeline via la configuration Spark.

    Les éléments doivent être spécifiés sous la forme de paires key:value.

    Disponible dans SDP en tant que configuration

  • parameters

    Entrez : object

    Important

    Cette fonctionnalité est en version bêta. Les administrateurs d’espace de travail peuvent contrôler l’accès à cette fonctionnalité à partir de la page Aperçus . Consultez Gérer les préversions d’Azure Databricks.

    Mappage facultatif de paires clé-valeur que le code source du pipeline peut référencer à l’aide de la syntaxe de paramètre nommée (par exemple, :source_catalog). Utilisez des paramètres pour réutiliser le même code source de pipeline dans des environnements ou des jeux de données sans modifier la source.

    Les clés peuvent contenir des caractères alphanumériques, des traits de soulignement (_), des traits d’union (-) et des points (.). Les valeurs sont toujours des chaînes.

    Vous pouvez remplacer ces valeurs par défaut lors du démarrage d’une mise à jour, sur une tâche de pipeline dans un travail ou avec des paramètres de travail poussés. Les paramètres de pipeline ne peuvent être référencés qu’à partir du code source SQL. Voir Utiliser des paramètres avec des pipelines.

    Pipelines Lakeflow uniquement

  • libraries

    Entrez : array of objects

    Tableau de fichiers de code contenant le code de pipeline et artefacts requis.

    Disponible dans SDP en tant que libraries, spécifié sous la forme d’une liste de modèles glob de fichier source plutôt qu’un tableau d’objets de fichier de code

  • clusters

    Entrez : array of objects

    Tableau de spécifications pour les clusters qui exécuteront le pipeline.

    Si ce n’est pas spécifié, les pipelines sélectionnent automatiquement une configuration de cluster par défaut pour le pipeline.

    Pipelines Lakeflow uniquement. SDP ne gère pas le calcul

  • development

    Entrez : boolean

    Indicateur indiquant s’il faut exécuter le pipeline en mode development ou en mode production.

    La valeur par défaut est false.

    Pipelines Lakeflow uniquement

  • notifications

    Entrez : array of objects

    Tableau facultatif de spécifications pour Notifications par e-mail lorsqu’une mise à jour de pipeline se termine, échoue avec une erreur pouvant faire de nouvelles tentatives, échoue avec une erreur non nouvelle tentative ou qu’un flux échoue.

    Pipelines Lakeflow uniquement

  • continuous

    Entrez : boolean

    Indicateur précisant s’il faut exécuter le pipeline en continu.

    La valeur par défaut est false.

    Pipelines Lakeflow uniquement

  • catalog

    Entrez : string

    Nom du catalogue par défaut du pipeline, où tous les jeux de données et métadonnées du pipeline sont publiés. La définition de cette valeur active le catalogue Unity pour le pipeline.

    Si ce paramètre n’est pas défini, le pipeline publie dans le metastore Hive hérité à l’aide de l’emplacement spécifié dans storage.

    En mode de publication hérité, spécifie le catalogue contenant le schéma cible où tous les jeux de données du pipeline actuel sont publiés. Consultez le schéma en direct (hérité).

    Disponible dans SDP en tant que catalog

  • schema

    Entrez : string

    Nom du schéma par défaut du pipeline, où tous les jeux de données et métadonnées du pipeline sont publiés par défaut. Voir Définir le catalogue cible et le schéma.

    Disponible dans SDP en tant que database, qui accepte également l’alias schema

  • target (hérité)

    Entrez : string

    Nom du schéma cible dans lequel tous les jeux de données définis dans le pipeline actuel sont publiés.

    Définir target au lieu de schema configure le pipeline pour utiliser le mode de publication hérité. Consultez le schéma en direct (hérité).

    Pipelines Lakeflow uniquement

  • storage (hérité)

    Entrez : string

    Emplacement dans DBFS ou le stockage cloud où sont stockées les données de sortie et les métadonnées requises pour l’exécution du pipeline. Les tables et les métadonnées sont stockées dans des sous-répertoires de cet emplacement.

    Lorsque le storage paramètre n’est pas spécifié, le système est défini par défaut sur un emplacement dans dbfs:/pipelines/.

    Le paramètre storage ne peut pas être modifié une fois le pipeline créé.

    Disponible dans SDP en tant que champ requis storage . Dans les pipelines Lakeflow, storage il s’agit d’un paramètre hérité

  • channel

    Entrez : string

    Version du runtime de pipeline à utiliser. Les valeurs prises en charge sont les suivantes :

    • preview pour tester votre pipeline avec les modifications à venir de la version du runtime.
    • current pour utiliser la version actuelle du runtime.

    Le champ channel est facultatif. La valeur par défaut est current. Databricks recommande d’utiliser la version actuelle du runtime pour les charges de travail de production.

    Pipelines Lakeflow uniquement

  • edition

    Tapez string

    Édition de produit à exécuter le pipeline. Ce paramètre vous permet de choisir la meilleure édition du produit en fonction des exigences de votre pipeline :

    • CORE pour exécuter des charges de travail d’ingestion de diffusion en continu.
    • PRO pour exécuter des charges de travail d'ingestion de flux et de capture des changements de données (CDC).
    • ADVANCED pour exécuter des charges de travail d’ingestion de streaming, des charges de travail CDC et des charges de travail qui nécessitent des exigences pour appliquer des contraintes de qualité des données.

    Le champ edition est facultatif. La valeur par défaut est ADVANCED.

    Pipelines Lakeflow uniquement

  • photon

    Entrez : boolean

    Indicateur précisant s’il faut utiliser Qu’est-ce que Photon ? pour exécuter le pipeline. Photon est le moteur Spark haute performance d’Azure Databricks. Les pipelines Photon sont facturés à un prix différent des pipelines non-Photon.

    Le champ photon est facultatif. La valeur par défaut est false.

    Pipelines Lakeflow uniquement

  • serverless

    Entrez : boolean

    Indicateur indiquant si le pipeline utilise le calcul serverless. Consultez Configurer un pipeline serverless.

    Pipelines Lakeflow uniquement

  • event_log

    Entrez : object

    Configuration de la destination du journal des événements du pipeline, en tant qu’objet avec name, cataloget schema des champs qui publient le journal des événements dans une table de catalogue Unity. Consultez le journal des événements pipeline.

    Pipelines Lakeflow uniquement

  • tags

    Entrez : object

    Carte facultative des balises définies par l’utilisateur pour le pipeline. Un maximum de 25 balises peut être ajouté.

    Pipelines Lakeflow uniquement

  • budget_policy_id

    Entrez : string

    ID de la stratégie de budget serverless à appliquer à ce pipeline, utilisé pour attribuer l’utilisation serverless pour le suivi des coûts. Ce champ apparaît dans la configuration JSON ou YAML uniquement lorsque vous définissez explicitement une stratégie. S’il n’est pas défini, Azure Databricks résout automatiquement une stratégie par défaut. La stratégie résolue est affichée dans l’interface utilisateur des paramètres de pipeline, mais elle n’est pas écrite dans la configuration JSON ou YAML.

    Pipelines Lakeflow uniquement

  • root_path

    Entrez : string

    Chemin racine du pipeline. Lorsqu’il est défini, ce répertoire est ajouté sys.path lors de l’exécution de fichiers sources Python, afin que les modules puissent être importés par rapport à celui-ci.

    Pipelines Lakeflow uniquement

  • environment

    Entrez : object

    Spécification d’environnement utilisée pour installer Python dépendances pour le pipeline.

    Pipelines Lakeflow uniquement

  • pipelines.maxFlowRetryAttempts

    Entrez : int

    Si une défaillance retentable se produit pendant une mise à jour de pipeline, il s’agit du nombre maximal de fois où réessayer un flux avant d’échouer la mise à jour du pipeline.

    Utilisez cette option pour lier les nouvelles tentatives sur un seul flux susceptible d’entraîner des échecs pouvant être retentés afin qu’il ne puisse pas bloquer une mise à jour entière.

    Valeur par défaut : deux tentatives de nouvelle tentative. Lorsqu’une défaillance retentable se produit, le runtime du pipeline tente d’exécuter le flux trois fois, y compris la tentative d’origine.

    Pipelines Lakeflow uniquement

  • pipelines.numUpdateRetryAttempts

    Entrez : int

    Si une défaillance retentable se produit pendant une mise à jour, il s’agit du nombre maximal de tentatives de nouvelle tentative de la mise à jour avant l’échec permanent de la mise à jour. La nouvelle tentative est exécutée en tant que mise à jour complète.

    Utilisez cette option pour lier les nouvelles tentatives sur une mise à jour entière. Par conséquent, une mise à jour bloquée échoue définitivement plutôt que de réessayer indéfiniment.

    Ce paramètre s’applique uniquement aux pipelines à l’aide du comportement de nouvelle tentative et de redémarrage automatique. Les nouvelles tentatives ne sont pas tentées pour les mises à jour ad hoc exécutées à partir de l’éditeur ou lorsque vous exécutez une Validate mise à jour.

    Par défaut:

    • Cinq pour les pipelines déclenchés.
    • Illimité pour les pipelines continus.

    Pipelines Lakeflow uniquement

Propriétés de la table de pipeline

Outre les propriétés des tables prises en charge par Delta Lake, vous pouvez définir les propriétés des tables suivantes.

  • pipelines.autoOptimize.zOrderCols

    Valeur par défaut : aucune

    Une chaîne facultative contenant des noms de colonnes séparés par des virgules qui détermine l’ordre de plan de cette table. Par exemple, pipelines.autoOptimize.zOrderCols = "year,month"

    Databricks recommande un clustering liquide au lieu de l’ordre Z pour optimiser la disposition des données dans les tables de pipeline. Pour permettre à Databricks de sélectionner et de gérer automatiquement les colonnes de clustering, utilisez CLUSTER BY AUTO (cluster_by_auto=Truedans Python). Consultez Utilisation de Liquid Clustering pour les tables.

    Pipelines Lakeflow uniquement

  • pipelines.reset.allowed

    Valeur par défaut : true

    Détermine si une actualisation complète de cette table est autorisée.

    Disponible dans SDP en tant que pipelines.reset.allowed

  • pipelines.autoOptimize.managed

    Valeur par défaut : true

    Active ou désactive automatiquement l’optimisation planifiée de cette table.

    Pour les pipelines gérés par l’optimisation prédictive, cette propriété n’est pas utilisée.

    Pipelines Lakeflow uniquement

Intervalle de déclenchement des pipelines

Vous pouvez spécifier un intervalle de déclencheur de pipeline pour l’ensemble du pipeline ou dans le cadre d’une déclaration de jeu de données. Consultez Définir l’intervalle de déclencheur pour les pipelines continus.

  • pipelines.trigger.interval

    La valeur par défaut est basée sur le type de flux :

    • Cinq secondes pour les requêtes de streaming.
    • Une minute pour les requêtes complètes lorsque toutes les données d’entrée proviennent de sources Delta.
    • Dix minutes pour les requêtes complètes lorsque certaines sources de données peuvent être non delta.

    La valeur est un nombre exprimé dans l’unité de temps choisie. Les unités de temps valides sont les suivantes :

    • second, seconds
    • minute, minutes
    • hour, hours
    • day, days

    Vous pouvez utiliser l’unité au singulier ou au pluriel lorsque vous définissez la valeur. Par exemple :

    • {"pipelines.trigger.interval" : "1 hour"}
    • {"pipelines.trigger.interval" : "10 seconds"}
    • {"pipelines.trigger.interval" : "30 second"}
    • {"pipelines.trigger.interval" : "1 minute"}
    • {"pipelines.trigger.interval" : "10 minutes"}
    • {"pipelines.trigger.interval" : "10 minute"}

    Pipelines Lakeflow uniquement

Attributs de cluster qui ne sont pas définis par l’utilisateur

Étant donné que les pipelines gèrent les cycles de vie du cluster, de nombreux paramètres de cluster sont définis par le système et ne peuvent pas être configurés manuellement par les utilisateurs, soit dans une configuration de pipeline, soit dans une stratégie de cluster utilisée par un pipeline. Le tableau suivant répertorie ces paramètres et explique pourquoi ils ne peuvent pas être définis manuellement.

Pipelines Lakeflow uniquement. SDP ne gère pas le calcul, de sorte que ces attributs de cluster ne s’appliquent pas

  • cluster_name

    SDP définit les noms des clusters utilisés pour exécuter les mises à jour de pipeline. Ces noms ne peuvent pas être remplacés.

  • data_security_mode

    access_mode

    Ces valeurs sont automatiquement définies par le système.

  • spark_version

    Les clusters SDP s’exécutent sur une version personnalisée de Databricks Runtime qui est continuellement mise à jour pour inclure les dernières fonctionnalités. La version de Spark est fournie avec la version Databricks Runtime et ne peut pas être remplacée.

  • autotermination_minutes

    Étant donné que SDP gère la logique d’arrêt automatique et de réutilisation du cluster, le temps de terminaison automatique du cluster ne peut pas être substitué.

  • runtime_engine

    Bien que vous puissiez contrôler ce champ en activant Photon pour votre pipeline, vous ne pouvez pas définir cette valeur directement.

  • effective_spark_version

    Cette valeur est automatiquement définie par le système.

  • cluster_source

    Ce champ est défini par le système et est en lecture seule.

  • docker_image

    Étant donné que SDP gère le cycle de vie du cluster, vous ne pouvez pas utiliser un conteneur personnalisé avec des clusters de pipeline.

  • workload_type

    Cette valeur est définie par le système et ne peut pas être remplacée.

Options de source et de requête

Certains comportements d’ingestion et de traitement des données sont configurés sur la source de données ou la requête plutôt que comme propriétés de pipeline. Il s’agit notamment de l’évolution du schéma, des indicateurs de schéma et de l’inférence, des limites de débit d’ingestion et du filtrage de fichiers. Pour les configurer, utilisez les options de read_files et du chargeur automatique. Pour l’évolution du schéma avec from_json, consultez Infer et faites évoluer le schéma à l’aide from_json de pipelines.