Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Référence pour les paramètres de configuration json du pipeline et les propriétés de table. Pour plus d’informations sur l’utilisation de ces propriétés et configurations, consultez les articles suivants :
Configuration des pipelines Lakeflow et pipelines déclaratifs Apache Spark™
Les pipelines Lakeflow sont basés sur des pipelines déclaratifs Apache Spark™ (SDP). La configuration du pipeline est en grande partie un super-ensemble de la spécification du projet SDP. Les différences d’utilisation des propriétés entre les pipelines SDP et Lakeflow sont notées. Pour une comparaison des fonctionnalités que les pipelines Lakeflow et le partage SDP partagent, consultez Pipelines déclaratifs Apache Spark.
Configurations de pipeline
idEntrez :
stringIdentificateur global unique (GUID) pour ce pipeline. L’identificateur est attribué par le système et ne peut pas être modifié.
Pipelines Lakeflow uniquement. SDP n’affecte pas d’identificateur de pipeline
nameEntrez :
stringNom convivial pour ce pipeline. Le nom peut servir à identifier les travaux du pipeline dans l’interface utilisateur.
Disponible dans SDP en tant que champ requis
nameconfigurationEntrez :
objectListe facultative des paramètres à ajouter à la configuration Spark du cluster qui exécute le pipeline. Ces paramètres sont lus par le runtime du pipeline et disponibles pour les requêtes de pipeline via la configuration Spark.
Les éléments doivent être spécifiés sous la forme de paires
key:value.Disponible dans SDP en tant que
configurationparametersEntrez :
objectImportant
Cette fonctionnalité est en version bêta. Les administrateurs d’espace de travail peuvent contrôler l’accès à cette fonctionnalité à partir de la page Aperçus . Consultez Gérer les préversions d’Azure Databricks.
Mappage facultatif de paires clé-valeur que le code source du pipeline peut référencer à l’aide de la syntaxe de paramètre nommée (par exemple,
:source_catalog). Utilisez des paramètres pour réutiliser le même code source de pipeline dans des environnements ou des jeux de données sans modifier la source.Les clés peuvent contenir des caractères alphanumériques, des traits de soulignement (
_), des traits d’union (-) et des points (.). Les valeurs sont toujours des chaînes.Vous pouvez remplacer ces valeurs par défaut lors du démarrage d’une mise à jour, sur une tâche de pipeline dans un travail ou avec des paramètres de travail poussés. Les paramètres de pipeline ne peuvent être référencés qu’à partir du code source SQL. Voir Utiliser des paramètres avec des pipelines.
Pipelines Lakeflow uniquement
librariesEntrez :
array of objectsTableau de fichiers de code contenant le code de pipeline et artefacts requis.
Disponible dans SDP en tant que
libraries, spécifié sous la forme d’une liste de modèles glob de fichier source plutôt qu’un tableau d’objets de fichier de codeclustersEntrez :
array of objectsTableau de spécifications pour les clusters qui exécuteront le pipeline.
Si ce n’est pas spécifié, les pipelines sélectionnent automatiquement une configuration de cluster par défaut pour le pipeline.
Pipelines Lakeflow uniquement. SDP ne gère pas le calcul
developmentEntrez :
booleanIndicateur indiquant s’il faut exécuter le pipeline en mode
developmentou en modeproduction.La valeur par défaut est
false.Pipelines Lakeflow uniquement
notificationsEntrez :
array of objectsTableau facultatif de spécifications pour Notifications par e-mail lorsqu’une mise à jour de pipeline se termine, échoue avec une erreur pouvant faire de nouvelles tentatives, échoue avec une erreur non nouvelle tentative ou qu’un flux échoue.
Pipelines Lakeflow uniquement
continuousEntrez :
booleanIndicateur précisant s’il faut exécuter le pipeline en continu.
La valeur par défaut est
false.Pipelines Lakeflow uniquement
catalogEntrez :
stringNom du catalogue par défaut du pipeline, où tous les jeux de données et métadonnées du pipeline sont publiés. La définition de cette valeur active le catalogue Unity pour le pipeline.
Si ce paramètre n’est pas défini, le pipeline publie dans le metastore Hive hérité à l’aide de l’emplacement spécifié dans
storage.En mode de publication hérité, spécifie le catalogue contenant le schéma cible où tous les jeux de données du pipeline actuel sont publiés. Consultez le schéma en direct (hérité).
Disponible dans SDP en tant que
catalogschemaEntrez :
stringNom du schéma par défaut du pipeline, où tous les jeux de données et métadonnées du pipeline sont publiés par défaut. Voir Définir le catalogue cible et le schéma.
Disponible dans SDP en tant que
database, qui accepte également l’aliasschematarget(hérité)Entrez :
stringNom du schéma cible dans lequel tous les jeux de données définis dans le pipeline actuel sont publiés.
Définir
targetau lieu deschemaconfigure le pipeline pour utiliser le mode de publication hérité. Consultez le schéma en direct (hérité).Pipelines Lakeflow uniquement
storage(hérité)Entrez :
stringEmplacement dans DBFS ou le stockage cloud où sont stockées les données de sortie et les métadonnées requises pour l’exécution du pipeline. Les tables et les métadonnées sont stockées dans des sous-répertoires de cet emplacement.
Lorsque le
storageparamètre n’est pas spécifié, le système est défini par défaut sur un emplacement dansdbfs:/pipelines/.Le paramètre
storagene peut pas être modifié une fois le pipeline créé.Disponible dans SDP en tant que champ requis
storage. Dans les pipelines Lakeflow,storageil s’agit d’un paramètre héritéchannelEntrez :
stringVersion du runtime de pipeline à utiliser. Les valeurs prises en charge sont les suivantes :
-
previewpour tester votre pipeline avec les modifications à venir de la version du runtime. -
currentpour utiliser la version actuelle du runtime.
Le champ
channelest facultatif. La valeur par défaut estcurrent. Databricks recommande d’utiliser la version actuelle du runtime pour les charges de travail de production.Pipelines Lakeflow uniquement
-
editionTapez
stringÉdition de produit à exécuter le pipeline. Ce paramètre vous permet de choisir la meilleure édition du produit en fonction des exigences de votre pipeline :
-
COREpour exécuter des charges de travail d’ingestion de diffusion en continu. -
PROpour exécuter des charges de travail d'ingestion de flux et de capture des changements de données (CDC). -
ADVANCEDpour exécuter des charges de travail d’ingestion de streaming, des charges de travail CDC et des charges de travail qui nécessitent des exigences pour appliquer des contraintes de qualité des données.
Le champ
editionest facultatif. La valeur par défaut estADVANCED.Pipelines Lakeflow uniquement
-
photonEntrez :
booleanIndicateur précisant s’il faut utiliser Qu’est-ce que Photon ? pour exécuter le pipeline. Photon est le moteur Spark haute performance d’Azure Databricks. Les pipelines Photon sont facturés à un prix différent des pipelines non-Photon.
Le champ
photonest facultatif. La valeur par défaut estfalse.Pipelines Lakeflow uniquement
serverlessEntrez :
booleanIndicateur indiquant si le pipeline utilise le calcul serverless. Consultez Configurer un pipeline serverless.
Pipelines Lakeflow uniquement
event_logEntrez :
objectConfiguration de la destination du journal des événements du pipeline, en tant qu’objet avec
name,catalogetschemades champs qui publient le journal des événements dans une table de catalogue Unity. Consultez le journal des événements pipeline.Pipelines Lakeflow uniquement
tagsEntrez :
objectCarte facultative des balises définies par l’utilisateur pour le pipeline. Un maximum de 25 balises peut être ajouté.
Pipelines Lakeflow uniquement
budget_policy_idEntrez :
stringID de la stratégie de budget serverless à appliquer à ce pipeline, utilisé pour attribuer l’utilisation serverless pour le suivi des coûts. Ce champ apparaît dans la configuration JSON ou YAML uniquement lorsque vous définissez explicitement une stratégie. S’il n’est pas défini, Azure Databricks résout automatiquement une stratégie par défaut. La stratégie résolue est affichée dans l’interface utilisateur des paramètres de pipeline, mais elle n’est pas écrite dans la configuration JSON ou YAML.
Pipelines Lakeflow uniquement
root_pathEntrez :
stringChemin racine du pipeline. Lorsqu’il est défini, ce répertoire est ajouté
sys.pathlors de l’exécution de fichiers sources Python, afin que les modules puissent être importés par rapport à celui-ci.Pipelines Lakeflow uniquement
environmentEntrez :
objectSpécification d’environnement utilisée pour installer Python dépendances pour le pipeline.
Pipelines Lakeflow uniquement
pipelines.maxFlowRetryAttemptsEntrez :
intSi une défaillance retentable se produit pendant une mise à jour de pipeline, il s’agit du nombre maximal de fois où réessayer un flux avant d’échouer la mise à jour du pipeline.
Utilisez cette option pour lier les nouvelles tentatives sur un seul flux susceptible d’entraîner des échecs pouvant être retentés afin qu’il ne puisse pas bloquer une mise à jour entière.
Valeur par défaut : deux tentatives de nouvelle tentative. Lorsqu’une défaillance retentable se produit, le runtime du pipeline tente d’exécuter le flux trois fois, y compris la tentative d’origine.
Pipelines Lakeflow uniquement
pipelines.numUpdateRetryAttemptsEntrez :
intSi une défaillance retentable se produit pendant une mise à jour, il s’agit du nombre maximal de tentatives de nouvelle tentative de la mise à jour avant l’échec permanent de la mise à jour. La nouvelle tentative est exécutée en tant que mise à jour complète.
Utilisez cette option pour lier les nouvelles tentatives sur une mise à jour entière. Par conséquent, une mise à jour bloquée échoue définitivement plutôt que de réessayer indéfiniment.
Ce paramètre s’applique uniquement aux pipelines à l’aide du comportement de nouvelle tentative et de redémarrage automatique. Les nouvelles tentatives ne sont pas tentées pour les mises à jour ad hoc exécutées à partir de l’éditeur ou lorsque vous exécutez une
Validatemise à jour.Par défaut:
- Cinq pour les pipelines déclenchés.
- Illimité pour les pipelines continus.
Pipelines Lakeflow uniquement
Propriétés de la table de pipeline
Outre les propriétés des tables prises en charge par Delta Lake, vous pouvez définir les propriétés des tables suivantes.
pipelines.autoOptimize.zOrderColsValeur par défaut : aucune
Une chaîne facultative contenant des noms de colonnes séparés par des virgules qui détermine l’ordre de plan de cette table. Par exemple,
pipelines.autoOptimize.zOrderCols = "year,month"Databricks recommande un clustering liquide au lieu de l’ordre Z pour optimiser la disposition des données dans les tables de pipeline. Pour permettre à Databricks de sélectionner et de gérer automatiquement les colonnes de clustering, utilisez
CLUSTER BY AUTO(cluster_by_auto=Truedans Python). Consultez Utilisation de Liquid Clustering pour les tables.Pipelines Lakeflow uniquement
pipelines.reset.allowedValeur par défaut :
trueDétermine si une actualisation complète de cette table est autorisée.
Disponible dans SDP en tant que
pipelines.reset.allowedpipelines.autoOptimize.managedValeur par défaut :
trueActive ou désactive automatiquement l’optimisation planifiée de cette table.
Pour les pipelines gérés par l’optimisation prédictive, cette propriété n’est pas utilisée.
Pipelines Lakeflow uniquement
Intervalle de déclenchement des pipelines
Vous pouvez spécifier un intervalle de déclencheur de pipeline pour l’ensemble du pipeline ou dans le cadre d’une déclaration de jeu de données. Consultez Définir l’intervalle de déclencheur pour les pipelines continus.
pipelines.trigger.intervalLa valeur par défaut est basée sur le type de flux :
- Cinq secondes pour les requêtes de streaming.
- Une minute pour les requêtes complètes lorsque toutes les données d’entrée proviennent de sources Delta.
- Dix minutes pour les requêtes complètes lorsque certaines sources de données peuvent être non delta.
La valeur est un nombre exprimé dans l’unité de temps choisie. Les unités de temps valides sont les suivantes :
-
second,seconds -
minute,minutes -
hour,hours -
day,days
Vous pouvez utiliser l’unité au singulier ou au pluriel lorsque vous définissez la valeur. Par exemple :
{"pipelines.trigger.interval" : "1 hour"}{"pipelines.trigger.interval" : "10 seconds"}{"pipelines.trigger.interval" : "30 second"}{"pipelines.trigger.interval" : "1 minute"}{"pipelines.trigger.interval" : "10 minutes"}{"pipelines.trigger.interval" : "10 minute"}
Pipelines Lakeflow uniquement
Attributs de cluster qui ne sont pas définis par l’utilisateur
Étant donné que les pipelines gèrent les cycles de vie du cluster, de nombreux paramètres de cluster sont définis par le système et ne peuvent pas être configurés manuellement par les utilisateurs, soit dans une configuration de pipeline, soit dans une stratégie de cluster utilisée par un pipeline. Le tableau suivant répertorie ces paramètres et explique pourquoi ils ne peuvent pas être définis manuellement.
Pipelines Lakeflow uniquement. SDP ne gère pas le calcul, de sorte que ces attributs de cluster ne s’appliquent pas
cluster_nameSDP définit les noms des clusters utilisés pour exécuter les mises à jour de pipeline. Ces noms ne peuvent pas être remplacés.
data_security_modeaccess_modeCes valeurs sont automatiquement définies par le système.
spark_versionLes clusters SDP s’exécutent sur une version personnalisée de Databricks Runtime qui est continuellement mise à jour pour inclure les dernières fonctionnalités. La version de Spark est fournie avec la version Databricks Runtime et ne peut pas être remplacée.
autotermination_minutesÉtant donné que SDP gère la logique d’arrêt automatique et de réutilisation du cluster, le temps de terminaison automatique du cluster ne peut pas être substitué.
runtime_engineBien que vous puissiez contrôler ce champ en activant Photon pour votre pipeline, vous ne pouvez pas définir cette valeur directement.
effective_spark_versionCette valeur est automatiquement définie par le système.
cluster_sourceCe champ est défini par le système et est en lecture seule.
docker_imageÉtant donné que SDP gère le cycle de vie du cluster, vous ne pouvez pas utiliser un conteneur personnalisé avec des clusters de pipeline.
workload_typeCette valeur est définie par le système et ne peut pas être remplacée.
Options de source et de requête
Certains comportements d’ingestion et de traitement des données sont configurés sur la source de données ou la requête plutôt que comme propriétés de pipeline. Il s’agit notamment de l’évolution du schéma, des indicateurs de schéma et de l’inférence, des limites de débit d’ingestion et du filtrage de fichiers. Pour les configurer, utilisez les options de read_files et du chargeur automatique. Pour l’évolution du schéma avec from_json, consultez Infer et faites évoluer le schéma à l’aide from_json de pipelines.