Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
Voici les limitations des pipelines Lakeflow qui sont importants à connaître au fur et à mesure que vous développez vos pipelines :
Un espace de travail Azure Databricks est limité à 1 000 mises à jour de pipeline simultanées. Le nombre de jeux de données qu’un seul pipeline peut contenir est déterminé par la complexité de la configuration du pipeline et de la charge de travail.
La configuration d’un pipeline inclut des références aux fichiers et dossiers sources.
Si la configuration référence uniquement des blocs-notes ou des fichiers individuels, la limite par pipeline est de 100 fichiers sources.
Si la configuration inclut des dossiers, vous pouvez inclure jusqu’à 50 entrées sources composées de fichiers ou de dossiers.
Le référencement d’un dossier référence indirectement les fichiers de ce dossier. Dans ce cas, la limite du nombre de fichiers référencés (directement ou indirectement) est de 1 000.
Si vous avez besoin de plus de 100 fichiers sources, organisez-les en dossiers. Pour savoir comment utiliser des dossiers pour contenir des fichiers sources, consultez le navigateur des ressources pipeline dans l’éditeur de pipeline Lakeflow.
Les jeux de données de pipeline ne peuvent être définis qu’une seule fois. En raison de cela, ils peuvent être la cible d’une seule opération sur tous les pipelines. L’exception concerne les tables de streaming avec traitement de flux d’ajout, qui permettent d’écrire dans une table de streaming à partir de plusieurs sources de streaming. Consultez les flux par défaut et les flux d’ajout.
Les colonnes d’identité présentent les limitations suivantes. Pour en savoir plus sur les colonnes d’identité dans les tables Delta, consultez Colonnes d’identité.
- Les colonnes d’identité ne sont pas prises en charge pour les tables ciblées par le traitement AUTO CDC.
- Les colonnes d’identité peuvent être recalculées lors des mises à jour des vues matérialisées. Pour cette raison, Databricks recommande d’utiliser les colonnes d’identité dans les pipelines uniquement avec des tables de streaming.
Par défaut, les vues matérialisées et les tables de diffusion en continu sont accessibles uniquement par Azure Databricks clients et applications. Pour les rendre accessibles aux systèmes externes, consultez Accéder aux vues matérialisées et aux tables de streaming à l’aide de systèmes externes.
Il existe des limitations pour le calcul Databricks requis pour exécuter et interroger des pipelines de catalogue Unity. Consultez les conditions requises pour les pipelines qui publient dans le catalogue Unity.
Les requêtes de voyage dans le temps Delta Lake sont prises en charge uniquement pour les tables de streaming et ne sont pas prises en charge pour les vues matérialisées. Voir Utiliser l’historique des tables.
La fonction
pivot()n’est pas prise en charge. L’opérationpivotdans Spark nécessite le chargement hâtif des données d’entrée pour calculer le schéma de sortie. Cette fonctionnalité n’est pas prise en charge dans les pipelines.
Pour connaître les quotas de ressources des pipelines Lakeflow, consultez les limites des ressources.