Nota
El acceso a esta página requiere autorización. Puede intentar iniciar sesión o cambiar directorios.
El acceso a esta página requiere autorización. Puede intentar cambiar los directorios.
Se aplica a:✅ Ingeniería de datos de tejido y ciencia de datos
Los perfiles de recursos de Fabric Data Engineering le ayudan a optimizar las configuraciones de proceso de Spark sin ajuste manual. Para describir la carga de trabajo, seleccione un caso de uso principal, un volumen de datos y algunas otras entradas de alto nivel. Después, Fabric genera una configuración recomendada, incluidos los tamaños de nodo, la configuración de escalabilidad automática y la versión del entorno de ejecución, en función de los procedimientos recomendados probados y los datos de rendimiento internos.
¿Por qué usar perfiles de recursos?
Los perfiles de recursos proporcionan:
- Optimizado desde el principio: la primera sesión de Spark se ejecuta en proceso optimizado para la carga de trabajo, sin que sea necesario realizar pruebas comparativas iterativas.
- Coherencia: todos los trabajos de Spark del área de trabajo comparten la misma configuración optimizada para el rendimiento.
- Mejor rendimiento de precio: los recursos de tamaño correcto reducen los residuos y mejoran el rendimiento.
- Menor sobrecarga operativa: menos ciclos de ajuste y menos escalaciones de soporte técnico.
Prerrequisitos
Para configurar perfiles de recursos, debe tener el rol Administrador para el área de trabajo.
Configuración de un perfil de recursos
Para configurar un perfil de recursos para el área de trabajo:
Vaya al área de trabajo y seleccione Configuración del área de trabajo.
Expanda Ingeniería de datos/Ciencia en el panel izquierdo y, a continuación, seleccione Configuración de Spark.
Para obtener una configuración de proceso recomendada para optimizar el uso de los recursos, en Optimizar para su caso de uso, seleccione Introducción.
En la página Optimizar para su caso de uso , proporcione las siguientes entradas:
- Caso de uso principal: seleccione la capa Medallion o basada en tareas y, a continuación, elija una opción específica en la lista desplegable. Las opciones de capa de medallón son Bronce, Plata o Oro. Las opciones basadas en tareas están optimizadas para lectura o optimizadas para escritura. Para obtener instrucciones sobre cómo elegir un caso de uso, consulte Referencia del caso de uso principal.
- Volumen de datos típico: seleccione un volumen en la lista desplegable: hasta 1 GB, 10GB, 100 GB, 1 TB o Más de 1 TB.
- Unidades de capacidad máximas (CU): use el control deslizante para establecer el límite máximo de CU para el grupo de Spark.
Seleccione Obtener recomendación.
Fabric genera una configuración optimizada basada en las entradas.
Revise la recomendación. La recomendación incluye valores para dos categorías:
- Grupo de Spark: tipo de grupo, familia de nodos, tamaño de nodo, escalado automático y asignación dinámica del ejecutor.
- Entorno: versión en tiempo de ejecución, núcleos y memoria del controlador de Spark, núcleos del ejecutor de Spark, memoria e instancias.
Si desea ajustar las entradas, seleccione la flecha atrás para volver a la página anterior, actualizar las selecciones y, a continuación, seleccione Obtener recomendación de nuevo.
Escriba un nombre de grupo de Spark y un entorno para la configuración y, a continuación, seleccione Aplicar para guardarlo en el área de trabajo.
Después de aplicar un perfil de recurso, Fabric crea un grupo de Spark personalizado con la configuración recomendada.
Nota:
Si el área de trabajo aún no tiene un grupo personalizado, el nuevo grupo se establece automáticamente como el grupo predeterminado para el área de trabajo. Si el área de trabajo ya tiene un grupo predeterminado, debe cambiar manualmente al nuevo grupo en la configuración del área de trabajo de Spark. Las sesiones activas no se ven afectadas hasta que se reinician.
Referencia del caso de uso principal
Use las instrucciones siguientes para seleccionar la entrada correcta del caso de uso principal al configurar un perfil de recurso:
Capa de Medallón
Elija Capa Medallion si la canalización de datos sigue el patrón de arquitectura Medallion, donde los datos se mueven a través de las fases Bronce (sin procesar), Plata (limpios) y Oro (curados). Cada opción ajusta la computación para las características de lectura y escritura típicas de esa fase.
| Caso de uso | Cuándo se deben usar |
|---|---|
| Bronce | Ingesta de datos sin procesar, alto rendimiento de escritura, diversos formatos |
| Plata | Limpieza y enriquecimiento, lectura/escritura equilibrada con combinaciones moderadas |
| Oro | Agregación e informes, optimizado para lectura para análisis y Power BI |
Basado en tareas
Elija Basado en tareas si la carga de trabajo no sigue el patrón medallion o si está dominada por un único patrón de acceso. Por ejemplo, use esta opción para trabajos ETL independientes, cuadernos de análisis interactivos o canalizaciones de streaming.
| Caso de uso | Cuándo se deben usar |
|---|---|
| Lectura optimizada | Lecturas y consultas frecuentes, cuadernos interactivos |
| Escritura optimizada | Ingesta de gran volumen, canalizaciones de ETL, streaming |
Actualización automática de perfiles de recursos
Los perfiles de recursos admiten una funcionalidad de actualización automática que mantiene la configuración de proceso de Spark alineada con las optimizaciones más recientes de Fabric. Cuando la actualización automática está habilitada, Fabric aplica propiedades de Spark específicas de la carga de trabajo en función del tipo de perfil de recurso, sin necesidad de ajustar manualmente.
Configuraciones de actualización automática
Fabric proporciona tres perfiles de actualización automática, cada uno optimizado para un patrón de carga de trabajo específico:
Lectura intensiva para cargas de trabajo de Spark
Configurado mediante spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate:
{
"spark.databricks.delta.optimizeWrite.enabled": "true",
"spark.databricks.delta.optimizeWrite.partitioned.enabled": "true",
"spark.databricks.delta.optimizeWrite.binSize": "128"
}
Use este perfil cuando la carga de trabajo esté dominada por las lecturas de Spark con necesidades de optimización de escritura moderadas.
De lectura intensiva para cargas de trabajo de Power BI
Configurado mediante spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate:
{
"spark.sql.parquet.vorder.default": "true",
"spark.databricks.delta.optimizeWrite.enabled": "true",
"spark.databricks.delta.optimizeWrite.binSize": "1g"
}
Use este perfil cuando los datos los consuma principalmente Power BI. V-Order está habilitado para un rendimiento óptimo de DirectLake y un tamaño de cubo mayor genera menos archivos más grandes adecuados para lecturas analíticas.
Cargas de trabajo con mucha actividad de escritura
Configurado mediante spark.fabric.resourceProfile.writeHeavyAutoUpdate:
{
"spark.sql.parquet.vorder.default": "false",
"spark.databricks.delta.optimizeWrite.binSize": "128",
"spark.databricks.delta.optimizeWrite.partitioned.enabled": "true"
}
Utilice este perfil cuando su carga de trabajo sea intensiva en escritura (por ejemplo, ingesta de gran volumen o ETL). El orden V está deshabilitado para reducir la sobrecarga de escritura y la escritura optimizada con particiones está habilitada para un diseño de archivo eficaz.
Funcionamiento de la actualización automática
Cuando se aplica un perfil de recurso con actualización automática:
- Fabric selecciona la configuración de actualización automática adecuada en función del caso de uso principal y el tipo de carga de trabajo.
- Las propiedades de Spark se aplican automáticamente a las nuevas sesiones del área de trabajo.
- Las sesiones activas no se ven afectadas hasta que se reinician.
Nota:
Las configuraciones de actualización automática optimizan el comportamiento de escritura y el diseño de archivos de Delta Lake dentro de los límites de las entradas de perfil originales. No cambian el tamaño del grupo, la configuración del nodo ni la configuración de escalado automático.
Referencia de configuración
| Configuración | Propiedades aplicadas | Cuándo se deben usar |
|---|---|---|
spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate |
Escritura optimizada habilitada, escritura particionada, tamaño de bloque de 128 MB | Análisis de Spark con uso intensivo de lectura |
spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate |
V-Order habilitado, optimización de escritura, tamaño de contenedor de 1 GB | Power BI/DirectLake con predominio de lectura |
spark.fabric.resourceProfile.writeHeavyAutoUpdate |
V-Order deshabilitado, escritura optimizada, tamaño de bloque de 128 MB, con particiones | Ingesta intensiva de escritura y ETL |