Priser för Dataflow Gen2 för Data Factory i Microsoft Fabric

Dataflöde Gen2 hjälper dig att enkelt forma och transformera data. Det erbjuder ett lågkodsgränssnitt och över 300 inbyggda data- och AI-transformeringar, som alla drivs av den välbekanta Power Query upplevelse som du hittar i Excel, Power BI, Power Platform och Dynamics 365. Dataflow Gen2 stöder också Spark-baserad transformeringskörning via MDF-transformeringar (mappning av dataflöde) för interna och migrerade arbetsbelastningar.

Den här prissättningen gäller för alla kapacitets-SKU:er för Fabric (F2 och högre). Prissättningen gäller inte för Fabric utvärderingskapacitet.

När du publicerar ett dataflöde skapas en definition som körs under uppdateringen. Dataflow Gen2-motorn använder den definitionen för att planera och hantera hur frågor körs över datakällor, gatewayer och beräkningsmotorer. Det skapar tabeller i mellanlagringsutrymme eller skickar dem till din valda destination och säkerställer tillförlitliga resultat utan tunga lyft.

Diagram över Arkitekturen Dataflöde Gen2.

Diagrammet visar komponenterna i Data Factory Dataflow Gen2-arkitekturen, inklusive Lakehouse som används för att mellanlagra data som importeras, och ett Warehouse-objekt som används som beräkningsmotor för att snabbare skriva resultat till mellanlagring eller utdata. När du inte kan använda Warehouse-beräkning, eller när du inaktiverar mellanlagring för en fråga, extraherar, transformerar eller laddar Mashup-motorn data till mellanlagring eller datamål. Mer information om hur Dataflow Gen2 fungerar finns i Data Factory Spotlight: Dataflow Gen2.

Dataflow Gen2 kan köra arbetsbelastningar med hjälp av antingen Mashup-motorn eller Spark-motorn. När MDF-transformeringar används i Dataflow Gen2 används Spark-baserad beräkning för transformeringskörning och databearbetning.

När du uppdaterar eller publicerar ett Dataflow Gen2-objekt förbrukas infrastrukturkapacitetsenheter för följande motorer:

  • Standardberäkning: Du debiteras för den baserat på frågeutvärderingstiden för alla dina Dataflödesfrågor som körs via Mashup-motorn.
  • Dataflödesberäkning i hög skala: Du debiteras när mellanlagring är aktiverat, baserat på förbrukningstiden för Sql-motorn i Lakehouse (Mellanlagring) och Warehouse (Storage Compute).
  • Snabbkopiering: Du debiteras när snabba kopieringskopplingar är aktiverade och kan användas i dataflödet baserat på varaktigheten för kopieringsjobbet.
  • Spark Compute: Du debiteras baserat på Spark-körningens varaktighet och Spark Core-användning när MDF-transformeringar körs under pipelinekörningar. Arbetsbelastningar för MDF-transformering i Dataflow Gen2 körs för närvarande genom dataflödesaktiviteten i Fabric Pipeline.

Prismodell för Dataflow Gen2

Hur prissättningspriserna bestäms

Prissättningen för Dataflow Gen2 beror på hur varje fråga använder beräkning. För standardberäkning körs frågor på mashupmotorn. Beroende på om ditt dataflöde är Dataflow Gen2 (CI/CD) varierar klassificeringen.

I Dataflow Gen2 (CI/CD) tillämpas en hastighet på två nivåer för frågevaraktigheten:

  • Om en fråga körs under 10 minuter klassificeras den till 12 CU
  • Om den körs längre klassificeras varje extra sekund med 1,5 CU.

Om ditt Dataflow Gen2 inte är CI/CD-baserat, tillämpas 16 CU på hela frågevaraktigheten.

För storskaliga scenarier, när staging är aktiverat, körs frågor på SQL-motorn för Lakehouse eller Warehouse. Varje sekund av beräkningstiden använder 6 CU-sekunder, så längre frågor förbrukar mer.

Om du aktiverar snabbkopiering finns det en separat hastighet för dataflytt: 1,5 CU, baserat på hur länge aktiviteten körs.

För MDF-transformeringsarbetsbelastningar debiteras du 1,5 CU per Spark-kärntimme baserat på Spark-körningens varaktighet och antalet Spark-kärnor som har allokerats för körningen.

I slutet av varje körning lägger Dataflow Gen2 ihop CU-användningen från varje motor och fakturerar den baserat på fabric-kapacitetspriset i din region.

CU-pristabell

Typ av Dataflow Gen2-motor Förbrukningsmätare CU-förbrukningshastighet Förbrukningsrapporteringskornighet
Standardberäkning (Dataflow Gen2 (CI/CD)) Baserat på varje frågekörningstid för kombinationsmotorn i sekunder. Standard Compute har priser på två nivåer beroende på frågevaraktigheten. - För varje sekund upp till 10 minuter, 12 CU
- För varje sekund längre än 10 minuter, 1,5 CU
Per Dataflow Gen2-objekt
Standard Compute (icke CI/CD) Baserat på varje frågekörningstid för kombinationsmotorn i sekunder. 16 CU Per Dataflow Gen2-objekt
Dataflödesberäkning i hög skala Baserat på körningen av Lakehouse/Warehouse SQL-motorn (med mellanlagring aktiverat) med angiven tid i sekunder. 6 CU Per arbetsyta
Dataflytt Baserat på varaktigheten för snabb kopieringskörning i sekunder och de använda intelligenta optimeringsdataflödesresurserna. 1,5 CU Per Dataflow Gen2-objekt
Mappa Data Flow transformerar beräkning (förhandsversion) Baserat på varaktigheten för MDF-transformeringskörning i sekunder med Spark-baserad beräkning i Dataflow Gen2. 1,5 CU per Spark core-hour

Exempel: Ett Spark-kluster med 8 kärnor förbrukar 12 CU för varje körningstimmes (8 × 1,5 CU).
Per Dataflow Gen2-objekt

Prissättning för virtuell nätverksdatagateway med Dataflow Gen2

Datagatewayen för virtuellt nätverk (VNET) faktureras som en tilläggsavgift för infrastruktur, associerad med en Fabric kapacitet. Det innebär att den har en egen mätare och ådrar sig en faktura som är konsekvent och extra för alla körningar av Fabric-objekt.

Den totala fakturan för att köra Dataflow Gen2 via Virtual Network Data Gateway beräknas som: Dataflow Gen2 Charge + Virtual Network Data Gateway Charge.

Avgiften för Virtual Network Data Gateway är proportionell mot din användning av Virtual Network Data Gateway, där användningen definieras som drifttid eller när Virtual Network Data Gateway är på.

CU-förbrukningstakt för datagateway i virtuellt nätverk: 4 CU

Läs mer i Priser och fakturering för virtuella nätverksdatagatewayer.

Ändringar i förbrukningstakten för Microsoft Fabric-arbetsbelastningar

Förbrukningsfrekvensen kan ändras när som helst. Microsoft använder rimliga ansträngningar för att meddela via e-post och produktmeddelande. Ändringarna träder i kraft det datum som anges i Versionsanteckningar och Microsoft Fabric-bloggen. Om någon ändring av förbrukningstakten för Microsoft Fabric-arbetsbelastningar väsentligt ökar de kapacitetsenheter (CU) som krävs för att använda en viss arbetsbelastning kan kunderna använda de avbokningsalternativ som är tillgängliga för den valda betalningsmetoden.

Beräkna uppskattade kostnader med hjälp av appen Fabric Metrics och uppdateringshistorik för dataflöde

Appen Microsoft Fabric Kapacitetsmått ger dig insyn i användningen av kapacitet för alla Fabric-arbetsytor som är knutna till en kapacitet. Den används av kapacitetsadministratörer för att övervaka prestanda för arbetsbelastningar och deras användning jämfört med köpt kapacitet. Att använda Metrics-appen är det mest exakta sättet att beräkna kostnaderna för uppdateringskörningar i Dataflow Gen2. För att förstå hur nivåindelade priser påverkade dina standardkostnader för beräkning måste du också använda uppdateringshistoriken för Dataflöde.

De här övningarna visar hur du validerar kostnader för både CI/CD- och icke CI/CD-dataflöden. För CI/CD-dataflödet med standardberäkning tillhandahålls ett fungerat exempel, följt av instruktioner för alla andra scenarier.

Övning 1: Standardberäkning för ett CI/CD-dataflöde

Följande dataflöde har två frågor som rör transformering och mellanlagring är inaktiverat.

Skärmbild som visar Dataflöde Gen2 med två frågor.

Skärmbild som visar Dataflöde Gen2 med mellanlagring inaktiverad.

Dataflöde Gen2 använder bara standardberäkningen.

För varje fråga får du åtkomst till frågevaraktigheten från uppdateringshistoriken och använder följande formel för att beräkna CU-förbrukningen per fråga.

För den första frågan är varaktigheten 2 131 sekunder.

Skärmbild som visar uppdateringshistorik för fråga 1.

På samma sätt är varaktigheten 913 sekunder för den andra frågan

Skärmbild som visar uppdateringshistorik för fråga 2.

StandardComputeCapacityConsumptionInCUSeconds = if(QueryDurationInSeconds < 600, QueryDurationInSeconds x 12, (QueryDurationInSeconds - 600) x 1.5 + 600 x 12)

För fråga 1 är den beräknade förbrukningen 9497 CU-sekunder och för fråga 2 är den beräknade förbrukningen 7670 CU-sekunder.

Aggregera kapacitetsförbrukningen i CU-sekunders och verifiera förbrukningen i appen för Fabric capacity metrics. I det här scenariot visar måttappen 17 180 CU-sekunder som Standard Compute-användning, vilket är bra att jämföra med den beräknade förbrukningen på 17 167 CU-sekunder. Eventuella avvikelser kan bero på avrundning i periodisk rapportering av användning.

Skärmbild som visar

Övning 2: Standardberäkning för ett icke-CI/CD-dataflöde

När ditt dataflöde omfattar transformering och mellanlagring är inaktiverat använder Dataflow Gen2 endast standardberäkningen.

För varje fråga får du åtkomst till frågevaraktigheten från uppdateringshistoriken och använder följande formel för att beräkna CU-förbrukningen per fråga.

StandardComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 16

Aggregera kapacitetsförbrukningen i CU-sekunders och verifiera förbrukningen i appen för Fabric capacity metrics.

Övning 3: Förstå användning av storskaliga beräkningsresurser (både CI/CD-dataflöden och dataflöden som inte använder CI/CD)

Om ditt dataflöde använder mellanlagring och du vill veta hur mycket High Scale-beräkning som användes öppnar du Fabric Capacity Metrics-appen och filtrerar på namnet på dataflödet. Högerklicka på namnet, leta efter beräkning i hög skala i listan över åtgärder och kontrollera varaktigheten.

HighScaleComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 6

Övning 4: Förstå förbrukning av beräkningsresurser vid snabbkopiering (både CI/CD- och icke-CI/CD-dataflöden)

Om ditt dataflöde använder snabb kopiering öppnar du appen Fabric Kapacitetsmått och filtrerar efter dataflödets namn för att ta reda på hur mycket dataförflyttningsberäkning du använde. Högerklicka på namnet, leta efter Dataflytt i listan över åtgärder och kontrollera varaktigheten.

FastCopyComputeCapacityConsumptionInCUSeconds = QueryDurationInSeconds x 1.5

Övning 5: Förstå beräkningsförbrukningen för Transform-transformeringen i mappningsdataflöde

Om ditt Dataflow Gen2 använder MDF-transformeringar kan du granska Spark-beräkningsförbrukning via appen Fabric Capacity Metrics genom att filtrera på objektnamnet för ditt Dataflow Gen2 och granska de Spark-relaterade körningsoperationer som är kopplade till körningen.

MDFTransformComputeConsumptionInCUSeconds = (SparkExecutionDurationInSeconds × NumberOfSparkCores × 1.5) / 3600

Example:

30 minuters körning med 8 Spark-kärnor:

(1800 × 8 × 1.5) / 3600 = 6 CU-seconds

Ytterligare överväganden:

  • Starttiden för Spark-körmiljön bidrar till den totala körningstiden.
  • MDF-transformeringens beräkningsförbrukning är separat från beräkningsförbrukningen för Mashup Engine, Fast Copy och High Scale Compute.
  • MDF-transformeringsfelsökningssessioner använder en fast Spark-konfiguration med 8 kärnor och använder 12 CU för varje timmes körning.