Configuración de perfiles de recursos en Microsoft Fabric

Se aplica a:✅ Ingeniería de datos de tejido y ciencia de datos

Los perfiles de recursos de Fabric Data Engineering le ayudan a optimizar las configuraciones de proceso de Spark sin ajuste manual. Para describir la carga de trabajo, seleccione un caso de uso principal, un volumen de datos y algunas otras entradas de alto nivel. Después, Fabric genera una configuración recomendada, incluidos los tamaños de nodo, la configuración de escalabilidad automática y la versión del entorno de ejecución, en función de los procedimientos recomendados probados y los datos de rendimiento internos.

¿Por qué usar perfiles de recursos?

Los perfiles de recursos proporcionan:

  • Optimizado desde el principio: la primera sesión de Spark se ejecuta en proceso optimizado para la carga de trabajo, sin que sea necesario realizar pruebas comparativas iterativas.
  • Coherencia: todos los trabajos de Spark del área de trabajo comparten la misma configuración optimizada para el rendimiento.
  • Mejor rendimiento de precio: los recursos de tamaño correcto reducen los residuos y mejoran el rendimiento.
  • Menor sobrecarga operativa: menos ciclos de ajuste y menos escalaciones de soporte técnico.

Prerrequisitos

Para configurar perfiles de recursos, debe tener el rol Administrador para el área de trabajo.

Configuración de un perfil de recursos

Para configurar un perfil de recursos para el área de trabajo:

  1. Vaya al área de trabajo y seleccione Configuración del área de trabajo.

  2. Expanda Ingeniería de datos/Ciencia en el panel izquierdo y, a continuación, seleccione Configuración de Spark.

  3. Para obtener una configuración de proceso recomendada para optimizar el uso de los recursos, en Optimizar para su caso de uso, seleccione Introducción.

    Captura de pantalla que muestra el botón Introducción en Optimizar para su caso de uso en la configuración de Spark.

  4. En la página Optimizar para su caso de uso , proporcione las siguientes entradas:

    • Caso de uso principal: seleccione la capa Medallion o basada en tareas y, a continuación, elija una opción específica en la lista desplegable. Las opciones de capa de medallón son Bronce, Plata o Oro. Las opciones basadas en tareas están optimizadas para lectura o optimizadas para escritura. Para obtener instrucciones sobre cómo elegir un caso de uso, consulte Referencia del caso de uso principal.
    • Volumen de datos típico: seleccione un volumen en la lista desplegable: hasta 1 GB, 10GB, 100 GB, 1 TB o Más de 1 TB.
    • Unidades de capacidad máximas (CU): use el control deslizante para establecer el límite máximo de CU para el grupo de Spark.
  5. Seleccione Obtener recomendación.

    Captura de pantalla que muestra el botón para obtener recomendaciones.

    Fabric genera una configuración optimizada basada en las entradas.

  6. Revise la recomendación. La recomendación incluye valores para dos categorías:

    • Grupo de Spark: tipo de grupo, familia de nodos, tamaño de nodo, escalado automático y asignación dinámica del ejecutor.
    • Entorno: versión en tiempo de ejecución, núcleos y memoria del controlador de Spark, núcleos del ejecutor de Spark, memoria e instancias.

    Captura de pantalla que muestra la configuración recomendada para el caso de uso seleccionado, incluido el perfil de recursos, la configuración del nodo y la versión en tiempo de ejecución.

    Si desea ajustar las entradas, seleccione la flecha atrás para volver a la página anterior, actualizar las selecciones y, a continuación, seleccione Obtener recomendación de nuevo.

  7. Escriba un nombre de grupo de Spark y un entorno para la configuración y, a continuación, seleccione Aplicar para guardarlo en el área de trabajo.

    Captura de pantalla que muestra el botón para aplicar recomendaciones.

Después de aplicar un perfil de recurso, Fabric crea un grupo de Spark personalizado con la configuración recomendada.

Nota:

Si el área de trabajo aún no tiene un grupo personalizado, el nuevo grupo se establece automáticamente como el grupo predeterminado para el área de trabajo. Si el área de trabajo ya tiene un grupo predeterminado, debe cambiar manualmente al nuevo grupo en la configuración del área de trabajo de Spark. Las sesiones activas no se ven afectadas hasta que se reinician.

Referencia del caso de uso principal

Use las instrucciones siguientes para seleccionar la entrada correcta del caso de uso principal al configurar un perfil de recurso:

Capa de Medallón

Elija Capa Medallion si la canalización de datos sigue el patrón de arquitectura Medallion, donde los datos se mueven a través de las fases Bronce (sin procesar), Plata (limpios) y Oro (curados). Cada opción ajusta la computación para las características de lectura y escritura típicas de esa fase.

Caso de uso Cuándo se deben usar
Bronce Ingesta de datos sin procesar, alto rendimiento de escritura, diversos formatos
Plata Limpieza y enriquecimiento, lectura/escritura equilibrada con combinaciones moderadas
Oro Agregación e informes, optimizado para lectura para análisis y Power BI

Basado en tareas

Elija Basado en tareas si la carga de trabajo no sigue el patrón medallion o si está dominada por un único patrón de acceso. Por ejemplo, use esta opción para trabajos ETL independientes, cuadernos de análisis interactivos o canalizaciones de streaming.

Caso de uso Cuándo se deben usar
Lectura optimizada Lecturas y consultas frecuentes, cuadernos interactivos
Escritura optimizada Ingesta de gran volumen, canalizaciones de ETL, streaming

Actualización automática de perfiles de recursos

Los perfiles de recursos admiten una funcionalidad de actualización automática que mantiene la configuración de proceso de Spark alineada con las optimizaciones más recientes de Fabric. Cuando la actualización automática está habilitada, Fabric aplica propiedades de Spark específicas de la carga de trabajo en función del tipo de perfil de recurso, sin necesidad de ajustar manualmente.

Configuraciones de actualización automática

Fabric proporciona tres perfiles de actualización automática, cada uno optimizado para un patrón de carga de trabajo específico:

Lectura intensiva para cargas de trabajo de Spark

Configurado mediante spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate:

{
    "spark.databricks.delta.optimizeWrite.enabled": "true",
    "spark.databricks.delta.optimizeWrite.partitioned.enabled": "true",
    "spark.databricks.delta.optimizeWrite.binSize": "128"
}

Use este perfil cuando la carga de trabajo esté dominada por las lecturas de Spark con necesidades de optimización de escritura moderadas.

De lectura intensiva para cargas de trabajo de Power BI

Configurado mediante spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate:

{
    "spark.sql.parquet.vorder.default": "true",
    "spark.databricks.delta.optimizeWrite.enabled": "true",
    "spark.databricks.delta.optimizeWrite.binSize": "1g"
}

Use este perfil cuando los datos los consuma principalmente Power BI. V-Order está habilitado para un rendimiento óptimo de DirectLake y un tamaño de cubo mayor genera menos archivos más grandes adecuados para lecturas analíticas.

Cargas de trabajo con mucha actividad de escritura

Configurado mediante spark.fabric.resourceProfile.writeHeavyAutoUpdate:

{
    "spark.sql.parquet.vorder.default": "false",
    "spark.databricks.delta.optimizeWrite.binSize": "128",
    "spark.databricks.delta.optimizeWrite.partitioned.enabled": "true"
}

Utilice este perfil cuando su carga de trabajo sea intensiva en escritura (por ejemplo, ingesta de gran volumen o ETL). El orden V está deshabilitado para reducir la sobrecarga de escritura y la escritura optimizada con particiones está habilitada para un diseño de archivo eficaz.

Funcionamiento de la actualización automática

Cuando se aplica un perfil de recurso con actualización automática:

  1. Fabric selecciona la configuración de actualización automática adecuada en función del caso de uso principal y el tipo de carga de trabajo.
  2. Las propiedades de Spark se aplican automáticamente a las nuevas sesiones del área de trabajo.
  3. Las sesiones activas no se ven afectadas hasta que se reinician.

Nota:

Las configuraciones de actualización automática optimizan el comportamiento de escritura y el diseño de archivos de Delta Lake dentro de los límites de las entradas de perfil originales. No cambian el tamaño del grupo, la configuración del nodo ni la configuración de escalado automático.

Referencia de configuración

Configuración Propiedades aplicadas Cuándo se deben usar
spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate Escritura optimizada habilitada, escritura particionada, tamaño de bloque de 128 MB Análisis de Spark con uso intensivo de lectura
spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate V-Order habilitado, optimización de escritura, tamaño de contenedor de 1 GB Power BI/DirectLake con predominio de lectura
spark.fabric.resourceProfile.writeHeavyAutoUpdate V-Order deshabilitado, escritura optimizada, tamaño de bloque de 128 MB, con particiones Ingesta intensiva de escritura y ETL