Transformace strukturovaných souborů na tabulky Delta

Pomocí zjednodušených transformací můžete převést strukturované soubory na dotazovatelné tabulky Delta. Pokud jsou zdrojová data už v tabulkovém formátu, jako je CSV, Parquet, JSON nebo Excel, transformace souborů automaticky zkopírují a převedou tato data do formátu Delta Lake, abyste je mohli dotazovat pomocí SQL, Sparku nebo Power BI bez vytváření kanálů ETL.

Informace o nestrukturovaných textových souborech, které potřebují zpracování umělé inteligence, jako je sumarizace, překlad nebo analýza sentimentu, najdete v tématu Transformace zkratkami (s podporou AI).

Klávesové zkratky zůstávají vždy synchronizované se zdrojovými daty. Výpočetní prostředí Fabric Spark provede transformaci a zkopíruje data pomocí zástupce OneLake do spravované tabulky Delta. Díky automatickému zpracování schématu, schopnostem hlubokého zploštění a podpoře více formátů komprese, zjednodušené transformace eliminují složitost sestavování a údržby ETL pipelines.

Proč používat zkratkové transformace?

  • Automatický převod – Fabric kopíruje a převádí zdrojové soubory do formátu Delta bez ruční orchestraci pipeline.
  • Častá synchronizace – Fabric pravidelně zjišťuje stav zástupce každé dvě minuty a synchronizují změny.
  • Rekurzivní zjišťování složek – Fabric automaticky prochází podsložky, aby detekoval a transformoval soubory v celé hierarchii adresářů.
  • Výstup Delta Lake – Výsledná tabulka je kompatibilní s jakýmkoli modulem Apache Spark.
  • Děděné řízení – zástupce přejímá historii OneLake, oprávnění a zásady Microsoft Purview.

Předpoklady

Požadavek Podrobnosti
Skladová položka Fabric Kapacita nebo zkušební verze, která podporuje úlohy Lakehouse.
Zdrojová data Složka, která obsahuje homogenní soubory CSV, Parquet, JSON nebo Excel.
Role pracovního prostoru Přispěvatel nebo vyšší

Podporované formáty souborů

Transformace zástupců fungují pro složky z libovolného zdroje dat, který zástupci v OneLake podporují.

Formát zdrojového souboru Podporovaná rozšíření Podporované typy komprese Podporovaný typ klávesové zkratky Poznámky
CSV (UTF-8, UTF-16) .csv, .txt (oddělovač), .tsv (oddělený tabulátorem), .psv (oddělený svislou čarou) .csv.gz, .csv.bz2 Klávesová zkratka pro tabulku .csv.zip a .csv.snappy nejsou podporovány.
Parquet .parquet .parquet.snappy, .parquet.gzip, .parquet.lz4, , .parquet.brotli.parquet.zstd Klávesová zkratka pro tabulku Žádné.
JSON .json, .jsonl, .ndjson .json.gz, .json.bz2, .jsonl.gz, .ndjson.gz, , .jsonl.bz2.ndjson.bz2 Klávesová zkratka pro tabulku .json.zip a .json.snappy nejsou podporovány.
Excel .xlsx, .xls Není relevantní Zástupce tabulky nebo zástupce schématu Zkratky pro tabulky sestavují listy do jedné tabulky Delta. Zkratky schématu vytvářejí jednu tabulku Delta na list. .xls (starší binární formát) je podporován na základě maximálního úsilí; .xlsx je doporučený formát.

Poznámka:

Transformace excelových souborů jsou aktuálně ve verzi Preview. Obecně dostupné jsou transformace CSV, Parquet a JSON.

Vytvořte zkratku pro tabulku s transformací dat

Zástupce tabulky vytvoří jednu tabulku Delta ve složce Tabulky datového úložiště. Slouží k transformaci souborů CSV, Parquet, JSON nebo Excelu.

Pro excelové soubory s více listy zkratka tabulky kombinuje vybrané listy do jedné tabulky Delta. Pokud potřebujete jednu tabulku typu Delta na list, vytvořte místo toho zkratku schématu.

  1. Ve svém jezeře klikněte pravým tlačítkem myši na schéma ve složce Tabulky a pak vyberte Zástupce nové tabulky. Vyberte zdroj zkratky, jako je Azure Data Lake, Azure Blob Storage, Dataverse, Amazon S3, GCP, SharePoint nebo OneDrive.

    Snímek obrazovky znázorňující vytvoření zkratky tabulky.

  2. Vyberte složku se soubory CSV, Parquet nebo JSON nebo vyberte složku, která obsahuje vaše .xlsx soubory.

  3. V kroku Transformace nakonfigurujte nastavení převodu Delta:

    • Soubory CSV:

      • Oddělovač – Vyberte znak použitý k oddělení sloupců, jako jsou čárka, středník, potrubí, tabulátor, ampersand nebo mezera.
      • První řádek jako záhlaví – Určuje, jestli první řádek obsahuje názvy sloupců.
    • Excelové soubory:

      • První řádek jako záhlaví – Určuje, jestli první řádek obsahuje názvy sloupců.
      • Listy, které chcete zahrnout – Vyberte všechny listy nebo jenom podmnožinu listů. Listy můžete vybrat podle názvu, podle indexu nebo pomocí zástupných znaků (například Sales_* odpovídá listům jako Sales_Q1 a Sales_2026). Porovnávání pomocí zástupných znaků není závislé na velikosti písmen.
  4. Zkontrolujte konfiguraci zástupce. V kroku Náhled zkratek můžete tato nastavení nakonfigurovat také před výběrem Vytvořit:

    • Název zástupce – Výběrem ikony tužky upravte název zástupce.
    • Zahrnout podsložky – Povolte rekurzivní zpracování souborů v vnořených podadresářích. Tato možnost je ve výchozím nastavení vybraná pro nové transformace. Pokud chcete zpracovat jenom složku nejvyšší úrovně, zrušte zaškrtnutí políčka.
  5. Sledujte aktualizace a protokoly v centru pro správu monitorování zkratek.

Výpočetní prostředí Fabric Spark vytvoří "tabulku Delta" a zobrazí průběh v podokně Správa zástupců.

U excelových souborů obsahuje __filepath__ výsledná tabulka Delta sloupce a __sheetname__ sloupce metadat, abyste mohli každý řádek sledovat zpět ke zdrojovému souboru a listu.

Vytvořte zástupce schématu s transformací dat

Zástupce schématu vytvoří více tabulek Delta, které se zobrazí pod novým schématem ve složce Tabulky ve složce Lakehouse. Můžete ho použít, když má excelový sešit více listů a chcete, aby byla na list jedna tabulka Delta.

Klávesové zkratky schématu s transformací dat jsou aktuálně dostupné jenom pro excelové (.xlsx) soubory. Vyžadují také jezerní dům s povolenými schématy. Další informace naleznete v tématu Schémata Lakehouse.

  1. V Lakehouse klikněte pravým tlačítkem myši na složku Tabulky a pak vyberte Nová zkratka schématu.

    Snímek obrazovky znázorňující vytvoření zástupce schématu

  2. Vyberte zdroj dat pro tuto klávesovou zkratku a přejděte do složky, která obsahuje vaše .xlsx soubory.

  3. V kroku Transformace nakonfigurujte nastavení převodu Delta:

    • První řádek jako záhlaví – Určuje, jestli první řádek obsahuje názvy sloupců.
    • Listy, které chcete zahrnout – Vyberte všechny listy nebo jenom podmnožinu listů. Listy můžete vybrat podle názvu, podle indexu nebo pomocí zástupných znaků.

    Snímek obrazovky znázorňující možnosti transformace pro zkratku schématu

  4. Zkontrolujte konfiguraci zástupce. V kroku Náhled zkratek můžete tato nastavení nakonfigurovat také před výběrem Vytvořit:

    • Název zástupce – Výběrem ikony tužky upravte název zástupce.
    • Zahrnout podsložky – Povolte rekurzivní zpracování souborů v vnořených podadresářích. Tato možnost je ve výchozím nastavení vybraná pro nové transformace. Pokud chcete zpracovat jenom složku nejvyšší úrovně, zrušte zaškrtnutí políčka.
  5. Sledujte aktualizace a protokoly v centru pro správu monitorování zkratek.

Výpočetní prostředí Fabric Spark vytváří pro vybrané listy samostatné tabulky Delta a udržuje je synchronizované se zdrojovými soubory. Názvy listů jsou automaticky sanitovány na platné názvy tabulek. Například list s názvem Sales Data (Q1) se stane Sales_Data_Q1.

Jak funguje synchronizace

Po počátečním načtení výpočetní prostředí Fabric Spark:

  • Dotazuje cíl zástupce každé dvě minuty.
  • Rozpozná nové nebo upravené soubory a odpovídajícím způsobem připojí nebo přepíše řádky.
  • Rozpozná odstraněné soubory a odebere odpovídající řádky.

Pokud je povolena podpora podsložek, systém rekurzivně vyhledá a zpracuje soubory ve všech vnořených podadresářích v cílové složce.

Monitorování a řešení potíží

Transformace zkratek zahrnují monitorování a zpracování chyb, které vám pomůžou sledovat stav příjmu dat a diagnostikovat problémy.

  1. Otevřete jezero a klikněte pravým tlačítkem myši na zástupce, který vaši transformaci předá.

  2. Vyberte Spravovat zástupce.

  3. V podokně podrobností můžete zobrazit:

    • Stav – výsledek poslední kontroly a aktuální stav synchronizace

    • Historie aktualizace – Chronologický seznam synchronizačních operací s počty řádků a všemi podrobnostmi o chybách

    • Zahrnout podsložky – Označuje, jestli je povolená transformace podsložky (Ano nebo Ne).

      Snímek obrazovky znázorňující centrum monitorování pro zobrazení stavu transformace

  4. Další podrobnosti najdete v protokolech pro řešení potíží.

    Snímek obrazovky, který ukazuje, jak získat přístup k souboru protokolu pro řešení potíží

Omezení

Na následující transformace zkratek se aktuálně vztahují tato omezení.

Obecná omezení

  • Zdrojový formát: Podporují se soubory CSV, JSON, Parquet a Excel.
  • Konzistence schématu souborů: Soubory musí sdílet stejné schéma.
  • Dostupnost pracovního prostoru: K dispozici pouze v položkách Lakehouse (nikoli v databázích Data Warehouses nebo KQL).
  • Operace zápisu: Transformace jsou optimalizované pro čtení. Přímé příkazy MERGE INTO nebo DELETE v cílové tabulce transformace nejsou podporované.
  • Dostupnost zástupce schématu: Klávesové zkratky schématu pro transformace souborů podporují jenom excelové soubory.

Omezení formátu CSV

  • Nepodporované datové typy: Komplexní logické typy – MAP/LIST/STRUCT, nezpracovaný binární soubor.

Omezení JSON

  • Zploštění datového typu pole: Datový typ pole se uchovává v tabulce Delta a je přístupný pomocí Spark SQL a PySpark. Pro další transformace použijte Fabric Materialized Lake Views pro vrstvu silver.
  • Hloubka zplošťování: Vnořené struktury jsou zploštěny až do pěti úrovní. Hlubší vnoření vyžaduje předběžné zpracování.

Omezení Excelu

  • Oblast buněk: Data se vždy čtou od buňky A1. Sešity, kde data začínají v jiné buňce nebo používají pojmenované tabulky nebo oblasti, nelze cílit.
  • Přeskočit řádky: Záhlaví, preambule metadat a souhrny zápatí nad nebo pod skutečnými daty nelze vyloučit. Jsou přijímány jako datové řádky.
  • Odvození schématu: Pro excelové soubory je vždy povoleno odvozování schématu. Identifikátory s úvodními nulami (například PSČ 02134 jako nebo ID zaměstnanců) 001245se převedou na celá čísla, která odeberou úvodní nuly.
  • Skryté listy: Všechny listy, včetně skrytých a systémových listů, se zpracovávají, pokud nejsou explicitně filtrovány podle názvu nebo indexu.
  • Formátování měny: Buňky formátované měnou (například $1,234.56) se převedou na prosté číselné hodnoty. Symbol měny se odstraní.
  • Popisky citlivosti: Sešity s popisky citlivosti od Microsoftu Purview nelze zpracovat.
  • Poškozené řádky: Čtečka Excelu nepodporuje izolaci poškozených záznamů. Poškozené nebo neodpovídající řádky v listu nelze izolovat a protokolovat samostatně.
  • Limit listu: Soubory s více než 25 listy se přeskočí.
  • Starší formát:.xls (starší binární formát) je podporován na základě nejlepšího úsilí a může mít omezenou věrnost pro komplexní formátování. .xlsx je doporučený formát.
  • Vyhodnocení vzorce: Spark přečte hodnotu v mezipaměti buněk vzorců. Pokud sešit nebyl uložen s vypočítanými hodnotami, buňky vzorců mohou být prázdné nebo zastaralé.

Omezení podsložky

  • K dispozici pouze pro nové transformace. Existující transformace nemůžou povolit podporu podsložek.
  • Jakmile je podpora podsložky povolená, nejde ji zakázat.
  • Klávesové zkratky vnořené do cílové složky se nesledují. Zpracovávají se pouze fyzické složky a soubory.
  • Selektivní zahrnutí nebo vyloučení konkrétních podsložek se nepodporuje.
  • Vnořené složky nefungují se zástupci SharePointu.

Informace o nových funkcích a vydáních najdete v cestovní mapě Fabric a na blogu aktualizace Fabric.

Vyčištění

Chcete-li synchronizaci zastavit, odstraňte v Průzkumníku Lakehouse transformaci zkratky.

Odstranění transformace neodebere podkladové soubory.