Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Platí pro: ✅ Warehouse v Microsoft Fabric
Tento článek popisuje metody migrace datových skladů v Azure Synapse Analytics specializovaných SQL poolech na Microsoft Fabric Data Warehouse.
Návod
Další informace o strategii a plánování migrace najdete v tématu Plánování migrace: Vyhrazené fondy SQL služby Azure Synapse Analytics do služby Fabric Data Warehouse.
Automatizované prostředí pro migraci z vyhrazených SQL fondů služby Azure Synapse Analytics je k dispozici pomocí Fabric Pomocník s migrací for Data Warehouse. Zbývající část tohoto článku obsahuje další kroky ruční migrace.
Tato tabulka shrnuje informace o schématu dat (DDL), kódu databáze (DML) a metodách migrace dat. Dále v tomto článku se podrobněji podíváme na jednotlivé scénáře, které jsou propojené ve sloupci Možnost .
| Číslo možnosti | Možnost | Jak funguje | Dovednost/předvolba | Scénář |
|---|---|---|---|---|
| 1 | Data Factory | Převod schématu (DDL) Extrakce dat Příjem dat |
ADF/Pipeline | Zjednodušili jsme vše v jednom schématu (DDL) a migraci dat. Doporučeno pro dimenzionální tabulky. |
| 2 | Data Factory s oddílem | Převod schématu (DDL) Extrakce dat Příjem dat |
ADF/Pipeline | Použití možností dělení ke zvýšení paralelismu čtení a zápisu, což zajišťuje desetinásobnou propustnost ve srovnání s možností 1, doporučeno pro tabulky faktů. |
| 3 | Data Factory s akcelerovaným kódem | Převod schématu (DDL) | ADF/Pipeline | Nejprve převeďte a migrujte schéma (DDL), poté pomocí CETAS extrahujte data a použijte COPY nebo Data Factory k jejich ingestování pro dosažení optimálního celkového výkonu při příjmu dat. |
| 4 | Zrychlený kód uložených procedur | Převod schématu (DDL) Extrakce dat Posouzení kódu |
T-SQL | Uživatel SQL používající integrované vývojové prostředí (IDE) s podrobnější kontrolou nad tím, na jakých úkolech chce pracovat. K ingestování dat použijte službu COPY/Data Factory. |
| 5 | Rozšíření projektu služby SQL Database pro Visual Studio Code | Převod schématu (DDL) Extrakce dat Posouzení kódu |
Projekt SQL | Projekt služby SQL Database pro nasazení s integrací možnosti 4. K ingestování dat použijte funkci COPY nebo Data Factory. |
| 6 | VYTVOŘIT EXTERNÍ TABULKU POMOCÍ SELECT (CETAS) | Extrakce dat | T-SQL | Nákladově efektivní a vysoce výkonná data extrahují do Azure Data Lake Storage (ADLS) Gen2. K ingestování dat použijte službu COPY/Data Factory. |
| 7 | Migrace pomocí dbt | Převod schématu (DDL) převod kódu databáze (DML) |
dbt | Stávající uživatelé dbt mohou pomocí adaptéru dbt Fabric převést své DDL a DML. Potom je nutné migrovat data pomocí dalších možností v této tabulce. |
Volba pracovního zatížení pro počáteční migraci
Při rozhodování, kde začít s dedikovaným SQL poolem pro Fabric Data Warehouse migrační projekt, vyberte oblast pracovní zátěže, kde můžete:
- Prokažte životaschopnost přechodu na Fabric Data Warehouse rychlým využitím výhod nového prostředí. Začněte pomalými a jednoduchými a připravte se na několik malých migrací.
- Umožňuje interním technickým pracovníkům získat relevantní zkušenosti s procesy a nástroji, které používají při migraci do jiných oblastí.
- Vytvořte šablonu pro další migrace, která je specifická pro zdrojové prostředí Synapse, a nástroje a procesy, které vám pomůžou.
Návod
Vytvořte inventář objektů, které je potřeba migrovat, a zdokumentujte proces migrace od začátku do konce, aby se mohl opakovat pro jiné vyhrazené fondy NEBO úlohy SQL.
Objem migrovaných dat při počáteční migraci by měl být dostatečně velký, aby demonstroval schopnosti a přínosy Fabric Data Warehouse prostředí, ale ne příliš velký na rychlé prokázání hodnoty. Velikost v rozsahu 1–10 terabajtů je typická.
Migrace pomocí služby Fabric Data Factory
V této části probereme možnosti použití služby Data Factory pro uživatele preferující platformy s minimálními nebo žádnými požadavky na programování, kteří mají zkušenosti se službou Azure Data Factory a Synapse Pipeline. Tato možnost přetahování uživatelského rozhraní poskytuje jednoduchý krok pro převod DDL a migraci dat.
Služba Fabric Data Factory může provádět následující úlohy:
- Převeďte schéma (DDL) na Fabric Data Warehouse syntaxi.
- Vytvořte schéma (DDL) na Fabric Data Warehouse.
- Migrujte data na Fabric Data Warehouse.
Možnost 1. Schéma/Migrace dat – Průvodce kopírováním a Aktivita ForEach kopírování
Tato metoda využívá Data Factory Copy Assistant k připojení ke zdrojovému dedikovanému SQL poolu, převodu dedikované SQL poolové DDL syntaxe na Fabric a kopírování dat do Fabric Data Warehouse. Můžete vybrat jednu nebo více cílových tabulek (pro TPC-DS datovou sadu je 22 tabulek). Vygeneruje forEach pro procházení seznamu tabulek vybraných v uživatelském rozhraní a vytvoří 22 paralelních vláken aktivity kopírování.
- 22 Výběrové dotazy (jeden pro každou vybranou tabulku) se vygenerovaly a spustily ve vyhrazeném fondu SQL.
- Ujistěte se, že máte odpovídající DWU a třídu prostředků, které umožňují spouštění dotazů vygenerovaných. V takovém případě potřebujete minimálně DWU1000,
staticrc10abyste umožnili maximálně 32 dotazům zpracovávat 22 odeslaných dotazů. - Přímé kopírování dat z dedikovaného SQL poolu do Fabric Data Warehouse Data Factory vyžaduje staging. Proces požití se skládá ze dvou fází.
- První fáze se skládá z extrahování dat z vyhrazeného fondu SQL do ADLS a označuje se jako příprava.
- Druhá fáze zpracovává data ze staging do Fabric Data Warehouse. Většina časového rozvrhu příjmu dat je ve fázi zpracování. V souhrnu má fáze přípravy výrazný dopad na efektivitu načítání dat.
Doporučené použití
Použití Průvodce kopírováním k vytvoření ForEach poskytuje jednoduché uživatelské rozhraní pro převod DDL a ingestování vybraných tabulek z dedikovaného SQL poolu na Fabric Data Warehouse v jednom kroku.
Není ale optimální s celkovou propustností. Hlavními faktory latence výkonu jsou požadavek na využití řízení fáze a potřeba paralelizovat čtení a zápis pro krok "Zdroj do fáze" (Source to Stage). Tuto možnost doporučujeme použít pouze pro tabulky dimenzí.
Možnost 2. DDL/Migrace dat – Potrubí s využitím volby rozdělení
Pokud chcete vyřešit zlepšení propustnosti načítání větších tabulek faktů pomocí kanálu Fabric, doporučujeme pro každou tabulku faktů s možností oddílu použít aktivitu kopírování. Toto poskytuje nejlepší výkon pro aktivitu kopírování.
Máte možnost použít fyzické dělení zdrojové tabulky, pokud je k dispozici. Pokud tabulka nemá fyzické oddíly, musíte zadat oddílový sloupec a určit minimální a maximální hodnoty pro využití dynamického dělení. Na následujícím snímku obrazovky určují možnosti zdroje pipeliny dynamický rozsah oddílů na základě sloupce ws_sold_date_sk.
Při používání dělení pro zvýšení propustnosti během fáze přípravy je třeba zvážit příslušné úpravy:
- V závislosti na rozsahu oddílů může využít všechny sloty souběžnosti, protože může generovat více než 128 dotazů ve vyhrazeném fondu SQL.
- Je požadováno, abyste škálovali na minimálně DWU6000, aby bylo možné provádět všechny dotazy.
- Například pro tabulku TPC-DS
web_salesse do vyhrazeného fondu SQL odeslalo 163 dotazů. Na DWU6000 bylo provedeno 128 dotazů, zatímco 35 dotazů bylo ve frontě. - Dynamický oddíl automaticky zvolí rozsahovou sekci. V tomto případě je 11denní rozsah u každého dotazu SELECT odeslaného do vyhrazeného fondu SQL. Například:
WHERE [ws_sold_date_sk] > '2451069' AND [ws_sold_date_sk] <= '2451080') ... WHERE [ws_sold_date_sk] > '2451333' AND [ws_sold_date_sk] <= '2451344')
Doporučené použití
U tabulek faktů doporučujeme ke zvýšení propustnosti použít službu Data Factory s možností dělení.
Zvýšené paralelizované čtení však vyžadují vyhrazený SQL pool, který se může škálovat na vyšší DWU, aby bylo možné provádět extrahovací dotazy. Díky využití partitioningu se rychlost zlepší desetkrát oproti možnosti bez partition. DWU můžete zvýšit, abyste získali větší propustnost přes výpočetní zdroje, ale dedikovaný SQL pool má maximálně povolených 128 aktivních dotazů.
Další informace o mapování Synapse DWU na službu Fabric najdete v blogu: Mapování dedikovaných SQL fondů Azure Synapse na výpočetní prostředky Fabric Data Warehouse.
Možnost 3. Migrace DDL – Průvodce kopírováním ForEach, aktivita kopírování
Dvě předchozí možnosti jsou skvělé možnosti migrace dat pro menší databáze. Pokud ale požadujete vyšší propustnost, doporučujeme alternativní možnost:
- Extrahujte data z vyhrazeného fondu SQL do ADLS, čímž se zmírní režie spojená s výkonem fáze.
- Použijte buď Data Factory, nebo příkaz COPY k načtení dat do vašeho skladu.
Doporučené použití
Data Factory můžete dál používat k převodu schématu (DDL). Pomocí Průvodce kopírováním můžete vybrat konkrétní tabulku nebo všechny tabulky. Navrženo tak, aby se schéma a data migrovaly v jednom kroku, přičemž se schéma extrahuje bez jakýchkoli řádků pomocí podmínky TOP 0 false v dotazovacím příkazu.
Následující ukázka kódu popisuje migraci schématu (DDL) se službou Data Factory.
Příklad kódu: Migrace schématu (DDL) se službou Data Factory
Fabric Pipelines můžete použít k snadné migraci DDL (schémat) pro objekty tabulek z jakéhokoliv zdrojového Azure SQL Database nebo dedikovaného SQL poolu. Tento pipeline migruje schéma (DDL) pro zdrojové SQL tabulky na Fabric Data Warehouse.
Návrh kanálu: parametry
Tento kanál přijímá parametr SchemaName, který umožňuje určit, která schémata se mají migrovat. Schéma dbo je výchozí.
Do pole Výchozí hodnota zadejte čárkami oddělený seznam schémat tabulky označující, která schémata se mají migrovat: 'dbo','tpch' pro poskytnutí dvou schémat dbo a tpch.
Návrh potrubí: Vyhledávací aktivita
Vytvořte aktivitu Vyhledávání a nastavte připojení tak, aby odkazovalo na zdrojovou databázi.
Na kartě Nastavení :
Nastavte typ úložiště dat na Externí.
Připojení je váš dedikovaný fond SQL služby Azure Synapse. Typ připojení je Azure Synapse Analytics.
Použít dotaz je nastaveno na Dotaz.
Pole Dotaz musí být vytvořeno pomocí dynamického výrazu, který umožňuje použít parametr
SchemaNamev dotazu, který vrací seznam cílových zdrojových tabulek. Vyberte Dotaz a pak vyberte Přidat dynamický obsah.Tento výraz v aktivitě LookUp generuje příkaz SQL pro dotazování systémových zobrazení pro načtení seznamu schémat a tabulek. Odkazuje na parametr,
SchemaNamekterý umožňuje filtrování SQL schémat. Výstupem je pole schématu SQL a tabulek, které se použijí jako vstup do aktivity ForEach.Pomocí následujícího kódu vrátíte seznam všech uživatelských tabulek s názvem schématu.
@concat(' SELECT s.name AS SchemaName, t.name AS TableName FROM sys.tables AS t INNER JOIN sys.schemas AS s ON t.type = ''U'' AND s.schema_id = t.schema_id AND s.name in (',coalesce(pipeline().parameters.SchemaName, 'dbo'),') ')
Návrh kanálu: Smyčka ForEach
Pro smyčku ForEach nakonfigurujte na kartě Nastavení následující možnosti:
- Chcete-li povolit souběžné spuštění více iterací, zakažte sekvenční.
- Nastavte počet dávek na
50a omezte maximální počet souběžných iterací. - Pole Položky musí používat dynamický obsah pro odkaz na výstup aktivity Vyhledávání. Použijte následující fragment kódu:
@activity('Get List of Source Objects').output.value
Návrh pipeline: Aktivita kopírování uvnitř ForEach smyčky
Uvnitř aktivity ForEach přidejte aktivitu kopírování. Tato metoda využívá Dynamic Expression Language v pipelinech k vytvoření tak, SELECT TOP 0 * FROM <TABLE> aby migrovala pouze schéma bez dat do skladu.
Na kartě Zdroj :
- Nastavte typ úložiště dat na Externí.
- Připojení je váš dedikovaný fond SQL služby Azure Synapse. Typ připojení je Azure Synapse Analytics.
- Nastavte Použít dotaz na Dotaz.
-
Do pole Dotaz vložte dotaz dynamického obsahu a použijte tento výraz, který vrátí nulové řádky, pouze schéma tabulky:
@concat('SELECT TOP 0 * FROM ',item().SchemaName,'.',item().TableName)
Na kartě Cíl :
- Nastavte typ úložiště dat na Pracovní prostor.
- Typ datového úložiště Workspace je Data Warehouse a Data Warehouse je nastaven na sklad.
- Schéma a název tabulky cílové tabulky jsou definovány pomocí dynamického obsahu.
- Schéma označuje pole
SchemaNameaktuální iterace se snippettem:@item().SchemaName - Tabulka odkazuje na TableName s fragmentem kódu:
@item().TableName
- Schéma označuje pole
Návrh potrubí: Sběrač
Pro propojovací bod, odkažte na váš sklad a uveďte jméno schématu zdroje a názvu tabulky.
Po spuštění této pipeline uvidíte, že váš datový sklad je plněný všemi tabulkami ze zdroje se správným schématem.
Migrace pomocí uložených procedur ve vyhrazeném fondu SYNApse SQL
Tato možnost používá uložené procedury k provedení migrace Fabric.
Ukázky kódu můžete získat v microsoft/fabric-migration na GitHub.com. Tento kód se sdílí jako opensourcový, takže můžete přispět ke spolupráci a pomoci komunitě.
Co mohou dělat migrační uložené procedury:
- Převeďte schéma (DDL) na Fabric Data Warehouse syntaxi.
- Vytvořte schéma (DDL) na Fabric Data Warehouse.
- Extrahujte data z vyhrazeného fondu SQL Synapse do ADLS.
- Označte nepodporovanou syntaxi Fabric pro T-SQL kódy (uložené procedury, funkce, pohledy).
Doporučené použití
Tato možnost je skvělá pro ty, kteří:
- Znáte T-SQL.
- Chcete použít integrované vývojové prostředí, jako je SQL Server Management Studio (SSMS).
- Chcete mít podrobnější kontrolu nad tím, na jakých úkolech chtějí pracovat.
Můžete spustit konkrétní uloženou proceduru pro převod schématu (DDL), extrakci dat nebo posouzení kódu T-SQL.
Pro migraci dat musíte použít buď COPY INTO Fabric Data Factory, abyste data do skladu vnesli.
Migrace s využitím projektů databáze SQL
Microsoft Fabric Data Warehouse je podporován v rozšíření SQL Database Projects, které je v editoru Visual Studio Code dostupné.
Toto rozšíření je k dispozici v editoru Visual Studio Code. Tato funkce umožňuje možnosti správy zdrojového kódu, testování databáze a ověřování schématu.
Pro více informací o řízení zdrojového kódu viz přehled vývoje a nasazení.
Doporučené použití
To je skvělá možnost pro ty, kteří preferují použití projektu služby SQL Database pro nasazení. Tato možnost v podstatě integruje uložené procedury migrace Fabric do projektu SQL Database, aby byla zajištěna plynulá migrace.
Projekt služby SQL Database může:
- Převeďte schéma (DDL) na Fabric Data Warehouse syntaxi.
- Vytvořte schéma (DDL) na Fabric Data Warehouse.
- Extrahujte data z vyhrazeného fondu SQL Synapse do ADLS.
- Označení nepodporované syntaxe pro kódy T-SQL (uložené procedury, funkce, zobrazení)
Pro migraci dat pak použijete buď COPY INTO nebo Data Factory k jejich ingestování do vašeho skladu.
Tým Microsoft Fabric CAT poskytl sadu skriptů PowerShellu pro zpracování extrakce, vytváření a nasazení schématu (DDL) a databázového kódu (DML) prostřednictvím projektu sql Database. Návod k použití projektu SQL Database s našimi užitečnými skripty PowerShellu najdete v tématu microsoft/fabric-migration na GitHub.com.
Další informace o projektech služby SQL Database najdete v tématu Začínáme s rozšířením Projekty služby SQL Database a sestavením databázového projektu z příkazového řádku.
Migrace dat pomocí CETAS
Příkaz T-SQL CREATE EXTERNAL TABLE AS SELECT (CETAS) poskytuje cenově nejvýhodnější a optimální metodu extrakce dat z vyhrazených fondů Synapse SQL do Azure Data Lake Storage (ADLS) Gen2.
Co může CETAS dělat:
- Extrahujte data do ADLS.
- Tato možnost vyžaduje, aby uživatelé vytvořili schéma (DDL) ve vašem skladu před vstupem dat. Zvažte možnosti migrace schématu (DDL) v tomto článku.
Výhody této možnosti:
- Ve zdrojovém vyhrazeném fondu SQL Synapse se odešle pouze jeden dotaz na každou tabulku. Tím se nevyužívají všechny sloty souběžnosti, takže nedojde k blokování souběžných produkčních ETL procesů a zákaznických dotazů.
- Škálování na DWU6000 se nevyžaduje, protože pro každou tabulku se používá jenom jeden slot souběžnosti, takže zákazníci můžou používat nižší jednotky DWU.
- Extrakce se spouští paralelně napříč všemi výpočetními uzly a je to klíčem ke zlepšení výkonu.
Doporučené použití
Pomocí CETAS extrahujte data do ADLS ve formě souborů Parquet. Soubory Parquet poskytují výhodu efektivního úložiště dat se sloupcovou kompresí, která spotřebuje méně šířky pásma při přenosu po síti. Vzhledem k tomu, že platforma Fabric ukládala data ve formátu Delta parquet, bude příjem dat 2,5krát rychlejší ve srovnání s formátem textového souboru, protože při příjmu dat není nutný žádný převod do formátu Delta.
Zvýšení propustnosti CETAS:
- Přidejte paralelní operace CETAS, čímž se zvýší využití slotů souběžnosti a zajistí se větší propustnost.
- Škálujte DWU v dedikovaném fondu SQL Synapse.
Migrace přes dbt
V této části probereme možnost dbt pro zákazníky, kteří už používají dbt ve svém aktuálním vyhrazeném prostředí fondu SQL Synapse.
Co dokáže dbt:
- Převeďte schéma (DDL) na Fabric Data Warehouse syntaxi.
- Vytvořte schéma (DDL) na Fabric Data Warehouse.
- Převeďte kód databáze (DML) na syntaxi Fabric.
Dbt Framework generuje za běhu DDL a DML (skripty SQL) při každém spuštění. U souborů modelu vyjádřených v příkazech SELECT lze DDL/DML okamžitě přeložit na libovolnou cílovou platformu změnou profilu (připojovací řetězec) a typu adaptéru.
Doporučené použití
Dbt Framework je přístup založený na kódu. Data se musí migrovat pomocí možností uvedených v tomto dokumentu, například CETAS nebo COPY/Data Factory.
DBT adaptér pro Microsoft Fabric Data Warehouse umožňuje migraci stávajících dbt projektů, které cílily na různé platformy, jako jsou Synapse dedikované SQL pooly, Snowflake, Databricks, Google Big Query nebo Amazon Redshift, migrovat do skladu jednoduchou změnou konfigurace.
Pro zahájení DBT projektu zaměřeného na Fabric Data Warehouse si přečtěte Návod: Nastavte dbt pro Fabric Data Warehouse. Tento dokument obsahuje také možnost přechodu mezi různými sklady a platformami.
Vstup dat do Fabric Data Warehouse
Pro vstup do Fabric Data Warehouse použijte COPY INTO nebo Fabric Data Factory, podle vašich preferencí. Obě metody jsou doporučené a nejvýkonnější, protože mají ekvivalentní propustnost výkonu vzhledem k předpokladu, že se soubory už extrahují do Azure Data Lake Storage (ADLS) Gen2.
Několik faktorů, které je potřeba poznamenat, abyste mohli navrhnout proces pro maximální výkon:
- U Fabric nedochází k žádnému soupeření zdrojů při načítání více tabulek z ADLS do Fabric Data Warehouse současně. Výsledkem je, že při načítání paralelních vláken nedojde ke snížení výkonu. Maximální propustnost příjmu dat bude omezena pouze výpočetním výkonem vaší kapacity Fabric.
- Správa zátěže v rámci systému poskytuje oddělení prostředků přidělených pro zátěž a dotazy. Při současném spuštění dotazů a načítání dat není žádné soupeření o prostředky.
Související obsah
- Nástroj Fabric Pomocník s migrací pro datový sklad
- Vytvoření skladu v Microsoft Fabric
- Pokyny k výkonu datového skladu Fabric
- Zabezpečení datových skladů v Microsoft Fabric
- Blog: Mapování vyhrazených SQL poolů Azure Synapse na výpočetní prostředky datového skladu Fabric
- Přehled migrace Microsoft Fabric