Remarque
L’accès à cette page requiert une autorisation. Vous pouvez essayer de vous connecter ou de modifier des répertoires.
L’accès à cette page requiert une autorisation. Vous pouvez essayer de modifier des répertoires.
S’applique à :✅ Ingénierie des données fabric et science des données
Les profils de ressources dans Fabric Data Engineering vous aident à obtenir des configurations de calcul Spark optimisées sans réglage manuel. Vous décrivez votre charge de travail en sélectionnant un cas d’usage principal, un volume de données et quelques autres entrées de haut niveau. Fabric génère ensuite une configuration recommandée, notamment les tailles de nœud, les paramètres de mise à l’échelle automatique et la version du runtime, en fonction des meilleures pratiques éprouvées et des données de performances internes.
Pourquoi utiliser des profils de ressources
Les profils de ressources fournissent :
- Optimisé à partir du début : votre première session Spark s’exécute sur le calcul paramétré pour votre charge de travail , sans évaluation itérative requise.
- Cohérence : tous les travaux Spark de l’espace de travail partagent la même configuration adaptée aux performances.
- Meilleures performances de prix : les ressources de taille appropriée réduisent les déchets et améliorent le débit.
- Réduction de la surcharge opérationnelle : moins de cycles de réglage et moins de prise en charge des escalades.
Prerequisites
Pour configurer des profils de ressources, vous devez disposer du rôle d’administrateur pour l’espace de travail.
Configurer un profil de ressource
Pour configurer un profil de ressource pour votre espace de travail :
Accédez à votre espace de travail, puis sélectionnez Paramètres de l’espace de travail.
Développez Data Engineering/Science dans le volet gauche, puis sélectionnez Paramètres Spark.
Pour obtenir une configuration de calcul recommandée pour optimiser l’utilisation de vos ressources, sous Optimiser pour votre cas d’utilisation, sélectionnez Prise en main.
Dans la page Optimiser pour votre cas d’usage , fournissez les entrées suivantes :
- Cas d’usage principal : sélectionnez soit la couche Medallion soit basée sur la tâche, puis choisissez une option spécifique dans la liste déroulante. Les options de couche de médaillon sont Bronze, Argent ou Or. Les options basées sur les tâches sont optimisées pour la lecture ou optimisées pour l'écriture. Pour obtenir des conseils sur le choix d’un cas d’usage, consultez la référence de cas d’usage principal.
- Volume de données classique : sélectionnez un volume dans la liste déroulante : jusqu’à 1 Go, 10 Go, 100 Go, 1 To ou plus de 1 To.
- Unités de capacité maximales (CU) : utilisez le curseur pour définir la limite maximale de cu pour le pool Spark.
Sélectionnez Obtenir une recommandation.
Fabric génère une configuration optimisée en fonction de vos entrées.
Passez en revue la recommandation. La recommandation inclut des valeurs pour deux catégories :
- Pool Spark : type de pool, famille de nœuds, taille de nœud, mise à l’échelle automatique et allocation d’exécuteur dynamique.
- Environnement : version du runtime, cœurs de pilote Spark et mémoire, cœurs d’exécuteur Spark, mémoire et instances.
Si vous souhaitez ajuster vos entrées, sélectionnez la flèche arrière pour revenir à la page précédente, mettez à jour vos sélections, puis sélectionnez Obtenir à nouveau la recommandation .
Entrez un nom de pool Spark et un environnement pour la configuration, puis sélectionnez Appliquer pour l’enregistrer dans l’espace de travail.
Après avoir appliqué un profil de ressource, Fabric crée un pool Spark personnalisé avec les paramètres recommandés.
Note
Si votre espace de travail n’a pas encore de pool personnalisé, le nouveau pool est automatiquement défini comme pool par défaut pour l’espace de travail. Si votre espace de travail possède déjà un pool par défaut, vous devez basculer manuellement vers le nouveau pool dans les paramètres de votre espace de travail Spark. Les sessions actives ne sont pas affectées tant qu’elles ne sont pas redémarrées.
Informations de référence sur le cas d’usage principal
Utilisez les instructions suivantes pour sélectionner l’entrée de cas d’usage principale appropriée lorsque vous configurez un profil de ressource :
Couche de médaillon
Choisissez la couche Medallion si votre pipeline de données suit le modèle d’architecture de médaillon, où les données passent par bronze (brut), Argent (nettoyé) et Or (organisé). Chaque option ajuste la capacité de traitement selon les caractéristiques de lecture/écriture typiques de cette étape.
| Cas d’utilisation | Quand utiliser |
|---|---|
| Bronze | Ingestion de données brutes, débit d’écriture élevé, formats variés |
| Argent | Nettoyage et enrichissement, lecture/écriture équilibrée avec des jointures modérées |
| Or | Agrégation et création de rapports, optimisée en lecture pour l’analytique et Power BI |
Basé sur des tâches
Choisissez Basé sur les tâches si votre charge de travail ne suit pas le modèle de médaillon ou si elle est dominée par un seul modèle d’accès. Par exemple, utilisez cette option pour les tâches ETL autonomes, les notebooks d'analyse interactive ou les flux de données.
| Cas d’utilisation | Quand utiliser |
|---|---|
| Lecture optimisée | Lectures et requêtes fréquentes, carnets interactifs |
| Écriture optimisée | Ingestion à volume élevé, pipelines ETL, streaming |
Mettre à jour automatiquement les profils de ressources
Les profils de ressources prennent en charge une fonctionnalité de mise à jour automatique qui maintient votre configuration de calcul Spark alignée sur les dernières optimisations de Fabric. Lorsque la mise à jour automatique est activée, Fabric applique des propriétés Spark spécifiques à la charge de travail en fonction de votre type de profil de ressource, sans nécessiter de réglage manuel.
Configurations de mise à jour automatique
Fabric fournit trois profils de mise à jour automatique, chacun paramétré pour un modèle de charge de travail spécifique :
Charges de travail Spark à forte intensité de lecture
Définir via spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate:
{
"spark.databricks.delta.optimizeWrite.enabled": "true",
"spark.databricks.delta.optimizeWrite.partitioned.enabled": "true",
"spark.databricks.delta.optimizeWrite.binSize": "128"
}
Utilisez ce profil lorsque votre charge de travail est dominée par les lectures Spark avec des besoins modérés d’optimisation de l’écriture.
Charges de travail Power BI à forte prédominance de lecture
Définir via spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate:
{
"spark.sql.parquet.vorder.default": "true",
"spark.databricks.delta.optimizeWrite.enabled": "true",
"spark.databricks.delta.optimizeWrite.binSize": "1g"
}
Utilisez ce profil lorsque vos données sont principalement consommées par Power BI. V-Order est activé pour des performances DirectLake optimales, et une plus grande taille de bac produit moins de fichiers plus grands adaptés aux lectures analytiques.
Charges de travail nécessitant beaucoup d’écritures
Définir via spark.fabric.resourceProfile.writeHeavyAutoUpdate:
{
"spark.sql.parquet.vorder.default": "false",
"spark.databricks.delta.optimizeWrite.binSize": "128",
"spark.databricks.delta.optimizeWrite.partitioned.enabled": "true"
}
Utilisez ce profil lorsque votre charge de travail est intensive en écriture (par exemple, ingestion à volume élevé ou ETL). V-Order est désactivé pour réduire la surcharge d’écriture et l’écriture optimisée avec le partitionnement est activée pour une disposition de fichier efficace.
Fonctionnement de la mise à jour automatique
Lorsqu’un profil de ressource avec mise à jour automatique est appliqué :
- Fabric sélectionne la configuration de mise à jour automatique appropriée en fonction de votre cas d’usage principal et du type de charge de travail.
- Les propriétés Spark sont appliquées automatiquement aux nouvelles sessions de l’espace de travail.
- Les sessions actives ne sont pas affectées tant qu’elles ne sont pas redémarrées.
Note
Les configurations de mise à jour automatique optimisent le comportement d’écriture et la disposition des fichiers Delta Lake dans les limites de vos entrées de profil d’origine. Ils ne modifient pas la taille de votre pool, la configuration de nœud ou les paramètres de mise à l’échelle automatique.
Référence de configuration
| Setting | Propriétés appliquées | Quand utiliser |
|---|---|---|
spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate |
Optimiser l’écriture activée, l’écriture partitionnée, la taille de compartiment de 128 Mo | Analyses Spark à forte dominante de lecture |
spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate |
V-Order activé, écriture optimisée, taille de compartiment de 1 Go | Power BI/DirectLake à forte charge de lecture |
spark.fabric.resourceProfile.writeHeavyAutoUpdate |
V-Order désactivé, écriture optimisée, taille de bac de 128 Mo, partitionné | Ingestion à forte intensité d’écriture et ETL |