Poznámka
Na prístup k tejto stránke sa vyžaduje oprávnenie. Môžete sa skúsiť prihlásiť alebo zmeniť adresáre.
Na prístup k tejto stránke sa vyžaduje oprávnenie. Môžete skúsiť zmeniť adresáre.
Vzťahuje sa na:✅ Warehouse v službe Microsoft Fabric
Sklad v Microsoft Fabric poskytuje zabudované nástroje na prijímanie dát. Použite tieto nástroje na získavanie dát do skladov vo veľkom rozsahu pomocou skúseností bez kódu alebo bohatých na kód.
Vyberte nástroj na prijímanie dát
Vyberte možnosť príjmu dát na základe nasledujúcich kritérií:
- Použite príkaz COPY (Transact-SQL) pre operácie príjmu dát bohatých na kód. Poskytuje najvyššiu priepustnosť príjmu dát. Používajte ho, keď potrebujete pridať príjem dát ako súčasť Transact-SQL logiky.
- Na začiatok si pozrite Ingest dát pomocou príkazu COPY.
- Sklad tiež podporuje tradičné
BULK INSERTvyhlásenie o kompatibilite. V Fabric Data Warehouse toto tvrdenie zodpovedáCOPY INTOsprávaniu s klasickými možnosťami načítania. - Výpis
COPYv Warehouse podporuje dátové zdroje z Azure storage účtov a priečinkov OneLake lakehouse.
- Použite BCP API (Preview) na priame prijímanie na strane klienta, keď sú dáta vo vašej aplikačnej vrstve a nemôžete najskôr fázovať súbory.
- Na začiatok si pozrite Ingest dát pomocou BCP API (Preview).
- BCP API podporuje bcp.exe skripty a aplikačné API ako C#
SqlBulkCopya JavaSQLServerBulkCopy. - Pre vstup súborov s najvyššou priepustnosťou uprednostňujte
COPY INTOfázovanie, ktoré je možné.
- Používajte pipeline na bezkódové alebo nízko-kódové, robustné workflowy na prijímanie dát, ktoré bežia opakovane, podľa harmonogramu alebo zahŕňajú veľké objemy dát.
- Na začiatok si pozrite Ingest dát do vášho skladu pomocou pipeline.
- Použitím pipeline môžete orchestrálne nastaviť robustné pracovné postupy pre plný zážitok z extrakcie, transformácie a načítania (ETL). Táto skúsenosť zahŕňa aktivity na prípravu cieľového prostredia, spúšťanie vlastných Transact-SQL príkazov, vyhľadávanie alebo kopírovanie dát zo zdroja do cieľa.
- Používajte dátové toky pre zážitok bez kódu, ktorý umožňuje vlastné transformácie na získanie dát pred ich prijatím.
- Na začiatok si pozrite Ingest dát pomocou dátového toku.
- Tieto transformácie zahŕňajú (no nielen) zmenu typov údajov, pridanie alebo odstránenie stĺpcov alebo použitie funkcií na vytvorenie vypočítaných stĺpcov.
- Použite príjem T-SQL na vytváranie nových tabuliek alebo aktualizáciu existujúcich tabuliek zdrojovými údajmi v rovnakom pracovnom priestore alebo externom úložisku.
- Na začiatok si pozrite Ingest dát do vášho skladu pomocou Transact-SQL.
- Použite Transact-SQL funkcie ako
INSERT...SELECT,SELECT INTOaleboCREATE TABLE AS SELECT (CTAS)na čítanie dát z tabuliek, ktoré odkazujú na iné sklady, jazerné domy alebo zrkadlové databázy v rámci toho istého pracovného priestoru. Tieto funkcie môžete tiež použiť na čítanie dát z funkcieOPENROWSET, ktorá odkazuje na súbory v externých Azure úložných účtoch. - Môžete tiež písať dotazy naprieč databázami medzi rôznymi skladmi vo vašom Fabric pracovnom priestore.
Podporované formáty údajov a zdroje údajov
Príjem dát pre Warehouse v Microsoft Fabric podporuje mnoho formátov a zdrojov dát. Každá možnosť uvedená v tomto článku obsahuje vlastný zoznam podporovaných typov dátových konektorov a formátov dát.
Pre T-SQL ingestion musia byť dátové zdroje tabuliek v rovnakom pracovnom priestore Microsoft Fabric a zdroje dát súborov musia byť v Azure Data Lake alebo Azure Blob úložisku. Dáta môžete vyhľadávať pomocou trojdielneho pomenovania alebo OPENROWSET funkcie pre zdrojové dáta. Zdroje dát v tabuľkách môžu odkazovať na dátové sady Delta Lake, zatiaľ čo OPENROWSET môže odkazovať na súbory Parquet, CSV alebo JSONL v Azure Data Lake alebo Azure Blob úložisku.
Napríklad, predpokladajme, že pracovný priestor má dva sklady, pomenované Inventory a Sales. Dotaz, ako je nasledujúci, vytvorí novú tabuľku v sklade Inventory , kde obsah tabuľky v sklade Inventory je spojený s tabuľkou v sklade Sales a s externými súbormi obsahujúcimi informácie o zákazníku:
CREATE TABLE Inventory.dbo.RegionalSalesOrders
AS
SELECT
s.SalesOrders,
i.ProductName,
c.CustomerName
FROM Sales.dbo.SalesOrders s
JOIN Inventory.dbo.Products i
ON s.ProductID = i.ProductID
JOIN OPENROWSET( BULK 'abfss://<container>@<storage>.dfs.core.windows.net/<customer-file>.csv' ) AS c
ON s.CustomerID = c.CustomerID
WHERE s.Region = 'West region';
Note
Čítanie dát pomocou môže OPENROWSET byť pomalšie ako dotazovanie údajov z tabuľky. Ak plánujete opakovane pristupovať k rovnakým externým údajom, zvážte ich prijatie do vyhradenej tabuľky, aby ste zlepšili výkon a efektivitu dotazov.
Príkaz COPY (Transact-SQL) momentálne podporuje formáty súborov CSV, JSONL a PARQUET. V prípade zdrojov údajov sú v súčasnosti podporované služby Azure Data Lake Storage (ADLS) Gen2 a Azure Blob Storage.
Pre priame klientské vstupné scenáre podporuje BCP API (Preview) nástroje a API ako bcp.exe, C# SqlBulkCopya Java SQLServerBulkCopy cez SQL pripojenia bez predchádzajúceho staging súborov.
Kanály a toky údajov podporujú širokú škálu zdrojov údajov a formátov údajov. Ďalšie informácie nájdete v téme Kanály a toky údajov.
Osvedčené postupy
Príkaz COPY v Warehouse v roku Microsoft Fabric poskytuje jednoduché, flexibilné a rýchle rozhranie pre vysokopriepustné spracovanie dát pre SQL pracovné zaťaženia. V aktuálnej verzii podporuje načítavanie dát iba z externých úložiskových účtov.
Môžete tiež použiť jazyk T-SQL na vytvorenie novej tabuľky a následné vloženie do nej a následnú aktualizáciu a odstránenie riadkov údajov. Dáta z akejkoľvek databázy v rámci pracovného priestoru Microsoft Fabric môžete vkladať pomocou dotazov medzi databázami. Ak chcete presunúť údaje zo služby Lakehouse do skladu, môžete to urobiť pomocou dotazu krížovej databázy. Napríklad:
INSERT INTO MyWarehouseTable
SELECT * FROM MyLakehouse.dbo.MyLakehouseTable;
- Vyhnite sa prijímaniu dát pomocou singleton
INSERTpríkazov, pretože tento prístup spôsobuje slabý výkon pri dotazoch a aktualizáciách. Ak používate singletonINSERTpríkazy na príjem dát postupne, vytvorte novú tabuľku pomocouCREATE TABLE AS SELECT (CTAS)orINSERT...SELECTpatterns, zrušte pôvodnú tabuľku a potom vytvorte tabuľku znova z tabuľky, ktorú ste vytvorili pomocou .CREATE TABLE AS SELECT (CTAS)- Pokles existujúcej tabuľky ovplyvní váš sémantický model vrátane všetkých vlastných mierok alebo prispôsobení, ktoré ste mohli urobiť v sémantickom modeli.
- Pri práci s externými dátami v súboroch sa uistite, že súbory majú aspoň 4 MB.
- V prípade veľkých komprimovaných súborov CSV zvážte rozdelenie súboru do viacerých súborov.
- Azure Data Lake Storage (ADLS) Gen2 ponúka lepší výkon ako Azure Blob Storage (staršia verzia). Vždy, keď je to možné, zvážte použitie konta ADLS Gen2.
- V prípade kanálov, ktoré sa často spúšťajú, zvážte izolovanie konta úložiska Azure z iných služieb, ktoré by mohli zároveň pristupovať k rovnakým súborom.
- Explicitné transakcie vám umožňujú zoskupiť viaceré zmeny údajov, takže sú viditeľné len pri čítaní jednej alebo viacerých tabuliek, keď je transakcia úplne viazaná. V prípade zlyhania niektorej zo zmien máte tiež možnosť vrátiť transakciu späť.
- Ak je a
SELECTv rámci transakcie a predchádzali mu vloženia dát, automaticky generované štatistiky môžu byť po návrate späť nepresné. Nepresné štatistiky môžu viesť k neooptimizovaným plánom dotazov a času vykonania. Ak vrátite transakciu s poSELECTveľkomINSERT, aktualizujte štatistiky pre stĺpce uvedené vo vašom .SELECT
Note
Bez ohľadu na to, ako dáta importujete do skladov, úloha spracovania dát optimalizuje vytvárané súbory parketových súborov pomocou optimalizácie zápisu vo V-Order. Objednávka V-Order optimalizuje súbory na parketoch tak, aby vo výpočtových nástrojoch služby Microsoft Fabric umožnila bleskové čítanie, ako sú napríklad Power BI, SQL, Spark a ďalšie. Skladové dotazy vo všeobecnosti profitujú z rýchlejšieho čítania dotazov vďaka tejto optimalizácii, pričom parketové súbory sú stále 100% v súlade s ich open-source špecifikáciou. Nevypínajte V-Order, môže to ovplyvniť výkon čítania. Ďalšie informácie o V-Order nájdete v téme Vysvetlenie a spravovanie V-Order for Warehouse.
Často kladené otázky týkajúce sa príjmu dát pre Fabric Data Warehouse
Aké sú pokyny na delenie súborov pre príkaz COPY na načítanie komprimovaných CSV súborov?
Zvážte rozdelenie veľkých CSV súborov, najmä ak je ich počet malý, ale nechajte súbory minimálne 4 MB pre lepší výkon.
Aké sú pokyny na delenie súborov pre príkaz COPY pri načítavaní Parquet súborov?
Zvážte rozdelenie veľkých súborov Parquet, najmä ak je počet súborov malý.
Existujú nejaké obmedzenia ohľadom počtu alebo veľkosti súborov?
Neexistujú žiadne obmedzenia na počet alebo veľkosť súborov. Pre najlepší výkon však používajte súbory s veľkosťou aspoň 4 MB.
Akú autentifikáciu používa príkaz COPY, ak nešpecifikujem prihlasovacie údaje?
Predvolene COPY INTO používa Microsoft Entra ID vykonávajúceho používateľa.