Resourceprofielen configureren in Microsoft Fabric

Van toepassing op:✅ Fabric Data Engineering en Data Science

Met resourceprofielen in Fabric Data Engineering kunt u geoptimaliseerde Spark-rekenconfiguraties krijgen zonder handmatige afstemming. U beschrijft uw workload door een primaire use-case, gegevensvolume en enkele andere invoer op hoog niveau te selecteren. Fabric genereert vervolgens een aanbevolen configuratie, waaronder knooppuntgrootten, instellingen voor automatisch schalen en runtimeversie, op basis van bewezen aanbevolen procedures en interne prestatiegegevens.

Waarom resourceprofielen gebruiken

Resourceprofielen bieden:

  • Geoptimaliseerd vanaf het begin: uw eerste Spark-sessie wordt uitgevoerd op rekenkracht die is afgestemd op uw workload. Er is geen iteratieve benchmarking vereist.
  • Consistentie: Alle Spark-taken in de werkruimte delen een prestatie-geoptimaliseerde configuratie.
  • Betere prijsprestaties: resources met de juiste grootte verminderen verspilling en verbeteren de doorvoer.
  • Lagere operationele overhead: minder afstemmingscycli en minder ondersteuningsescalaties.

Vereiste voorwaarden

Als u resourceprofielen wilt configureren, moet u de beheerdersrol voor de werkruimte hebben.

Een resourceprofiel configureren

Ga als volgende te werk om een resourceprofiel voor uw werkruimte te configureren:

  1. Ga naar uw werkruimte en selecteer Werkruimte-instellingen.

  2. Vouw Data Engineering/Science uit in het linkerdeelvenster en selecteer vervolgens Spark-instellingen.

  3. Als u een aanbevolen rekenconfiguratie wilt krijgen om uw resourcegebruik te optimaliseren, selecteert u Aan de slag onder Optimaliseren voor uw use-case.

    Schermopname van de knop Aan de slag onder Optimaliseren voor uw use case in Spark-instellingen.

  4. Geef op de pagina Optimaliseren voor uw use-case de volgende invoer op:

    • Primaire gebruikscase: Selecteer Medallion-laag of Taak-gebaseerd en kies vervolgens een specifieke optie in de vervolgkeuzelijst. Opties voor medal medallagen zijn Brons, Zilver of Goud. Op taken gebaseerde opties zijn geoptimaliseerd voor lezen of geoptimaliseerd voor schrijven. Zie Primaire gebruiksvoorbeeldenreferentie voor richtlijnen bij het kiezen van een gebruiksvoorval.
    • Typisch gegevensvolume: Selecteer een volume in de vervolgkeuzelijst: Maximaal 1 GB, 10 GB, 100 GB, 1 TB of Meer dan 1 TB.
    • Maximumcapaciteitseenheden (CU):gebruik de schuifregelaar om de maximale CU-limiet voor de Spark-pool in te stellen.
  5. Selecteer Aanbeveling ophalen.

    Schermopname van de knop om aanbevelingen te krijgen.

    Fabric genereert een geoptimaliseerde configuratie op basis van uw invoer.

  6. Bekijk de aanbeveling. De aanbeveling bevat waarden voor twee categorieën:

    • Spark-pool: pooltype, knooppuntfamilie, knooppuntgrootte, automatische schaalaanpassing en dynamische uitvoerderstoewijzing.
    • Omgeving: Runtimeversie, Kernen en geheugen van Spark-stuurprogramma's, Spark-uitvoerders, geheugen en exemplaren.

    Schermopname van de aanbevolen configuratie voor de geselecteerde use case, inclusief resourceprofiel, knooppuntinstellingen en runtimeversie.

    Als u de invoer wilt aanpassen, selecteert u de pijl-terug om terug te keren naar de vorige pagina, werkt u uw selecties bij en selecteert u vervolgens Aanbeveling ophalen opnieuw.

  7. Voer de naam en omgeving van een Spark-pool in voor de configuratie en selecteer Toepassen om deze op te slaan in de werkruimte.

    Schermopname van de knop om aanbevelingen toe te passen.

Nadat u een resourceprofiel hebt toegepast, maakt Fabric een aangepaste Spark-pool met de aanbevolen instellingen.

Opmerking

Als uw werkruimte nog geen aangepaste pool heeft, wordt de nieuwe pool automatisch ingesteld als de standaardgroep voor de werkruimte. Als uw werkruimte al een standaardgroep heeft, moet u handmatig overschakelen naar de nieuwe pool in de instellingen van uw Spark-werkruimte. Actieve sessies worden pas beïnvloed nadat ze opnieuw zijn opgestart.

Referentie voor primaire gebruiksscenario

Gebruik de volgende richtlijnen om de juiste primaire use case-invoer te selecteren wanneer u een resourceprofiel configureert:

Medaillonlaag

Kies Medallion-laag als uw gegevenspijplijn het patroon van de medallion-architectuur volgt, waarbij gegevens worden verplaatst door bronzen (onbewerkte), zilveren (opgeschoonde) en gouden (gecurateerde) fasen. Elke optie is geschikt voor berekeningen voor de lees-/schrijfkenmerken die typisch zijn voor die fase.

Gebruiksituatie Wanneer gebruiken
Brons Onbewerkte gegevensopname, hoge schrijfdoorvoer, diverse indelingen
Zilver Opschoning en verrijking, evenwichtig lezen/schrijven met gematigde joins
Goud Aggregatie en rapportage, geoptimaliseerd voor lezen voor analyse en Power BI

Op basis van taken

Kies Taakgebaseerd als uw werklast het medaillonpatroon niet volgt of wordt gedomineerd door één toegangspatroon. Gebruik deze optie bijvoorbeeld voor zelfstandige ETL-taken, interactieve analysenotebooks of streamingpijplijnen.

Gebruiksituatie Wanneer gebruiken
Geoptimaliseerd lezen Frequente lees- en queries, interactieve notebooks
Geoptimaliseerd schrijven Opname van grote volumes, ETL-pijplijnen, streaming

Resourceprofielen automatisch bijwerken

Resourceprofielen ondersteunen een functie voor automatisch bijwerken waarmee uw Spark-rekenconfiguratie wordt afgestemd op de meest recente optimalisaties van Fabric. Wanneer automatisch bijwerken is ingeschakeld, past Fabric workloadspecifieke Spark-eigenschappen toe op basis van uw resourceprofieltype, zonder dat u handmatig hoeft af te stemmen.

Configuraties voor automatisch bijwerken

Fabric biedt drie profielen voor automatisch bijwerken, die elk zijn afgestemd op een specifiek workloadpatroon:

Leesintensief voor Spark-workloads

Instellen via spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate:

{
    "spark.databricks.delta.optimizeWrite.enabled": "true",
    "spark.databricks.delta.optimizeWrite.partitioned.enabled": "true",
    "spark.databricks.delta.optimizeWrite.binSize": "128"
}

Gebruik dit profiel wanneer uw workload wordt gedomineerd door Spark-leesbewerkingen met gemiddelde schrijfoptimalisatiebehoeften.

Leesintensief voor Power BI-werkbelastingen

Instellen via spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate:

{
    "spark.sql.parquet.vorder.default": "true",
    "spark.databricks.delta.optimizeWrite.enabled": "true",
    "spark.databricks.delta.optimizeWrite.binSize": "1g"
}

Gebruik dit profiel wanneer uw gegevens voornamelijk worden gebruikt door Power BI. V-order is ingeschakeld voor optimale Direct Lake-prestaties, en een grotere bin-grootte levert minder, grotere bestanden op die geschikt zijn voor analytische reads.

Schrijfintensieve workloads

Instellen via spark.fabric.resourceProfile.writeHeavyAutoUpdate:

{
    "spark.sql.parquet.vorder.default": "false",
    "spark.databricks.delta.optimizeWrite.binSize": "128",
    "spark.databricks.delta.optimizeWrite.partitioned.enabled": "true"
}

Gebruik dit profiel wanneer uw werkbelasting schrijfintensief is (bijvoorbeeld opname van grote volumes of ETL). V-volgorde is uitgeschakeld om schrijfoverhead te verminderen, en geoptimaliseerd schrijven met partitatie is ingeschakeld voor een efficiënte bestandsindeling.

Hoe automatisch bijwerken werkt

Wanneer een resourceprofiel met automatisch bijwerken wordt toegepast:

  1. Fabric de juiste configuratie voor automatisch bijwerken selecteert op basis van uw primaire use-case en workloadtype.
  2. De Spark-eigenschappen worden automatisch toegepast op nieuwe sessies in de werkruimte.
  3. Actieve sessies worden pas beïnvloed als ze opnieuw worden opgestart.

Opmerking

Configuraties voor automatisch bijwerken optimaliseren het schrijfgedrag en de bestandsindeling van Delta Lake binnen de grenzen van de oorspronkelijke profielinvoer. Ze wijzigen de grootte van uw pool, knooppuntconfiguratie of instellingen voor automatisch schalen niet.

Configuratiegids

Configuratie Toegepaste eigenschappen Wanneer gebruiken
spark.fabric.resourceProfile.readHeavyForSparkAutoUpdate Schrijfbewerking optimaliseren ingeschakeld, gepartitioneerd schrijven, bingrootte van 128 MB Leesintensieve Spark-analyse
spark.fabric.resourceProfile.readHeavyForPBIAutoUpdate V-order ingeschakeld, schrijven optimaliseren, 1 GB bin-grootte Leeszware Power BI/DirectLake
spark.fabric.resourceProfile.writeHeavyAutoUpdate V-order uitgeschakeld, schrijven optimaliseren, 128 MB bin-grootte, gepartitioneerd Intensieve schrijfbewerkingen en gegevensinname en ETL