Použití vzorů sloupců v mapování toků dat

VZTAHUJE SE NA: Azure Data Factory Azure Synapse Analytics

Tip

Data Factory v Microsoft Fabric je nová generace Azure Data Factory s jednodušší architekturou, integrovanou AI a novými funkcemi. Pokud s integrací dat začínáte, začněte Fabric Data Factory. Stávající úlohy ADF lze upgradovat na Fabric pro přístup k novým funkcím v oblastech datové vědy, analýz v reálném čase a vytváření sestav.

Několik transformací mapování toků dat umožňuje odkazovat na sloupce šablon založené na vzorech místo pevně zakódovaných názvů sloupců. Tato shoda se označuje jako vzory sloupců. Můžete definovat vzory tak, aby odpovídaly sloupcům na základě názvu, datového typu, datového proudu, zdroje nebo pozice, a nemusíte vyžadovat přesné názvy polí. Existují dva scénáře, ve kterých jsou vzorce sloupců užitečné:

  • Pokud se příchozí zdrojová pole často mění, například případ změny sloupců v textových souborech nebo NoSQL databází. Tento scénář se označuje jako posun schématu.
  • Pokud chcete provést běžnou operaci u velké skupiny sloupců. Například chtít přetypovat každý sloupec, který má v názvu "total", na typ double.

Šablony sloupců v odvozených sloupcích a agregacích

Pokud chcete přidat vzor sloupce do odvozeného sloupce, agregace nebo transformace okna, klikněte na Přidat nad seznam sloupců nebo ikonu plus vedle existujícího odvozeného sloupce. Zvolte Přidat vzor sloupce.

Snímek obrazovky znázorňující ikonu plus pro přidání vzorku sloupce

Pomocí generátoru výrazů zadejte podmínku shody. Vytvořte logický výraz, který odpovídá sloupcům na základě name, type, stream, origin a position sloupce. Vzor ovlivní jakýkoli sloupec, posun nebo definovaný, kde podmínka vrátí hodnotu true.

Snímek obrazovky znázorňující kartu Nastavení odvozeného sloupce

Výše uvedený vzor sloupce odpovídá každému sloupci typu double a vytvoří jeden odvozený sloupec za každou shodu. Když jako pole s názvem sloupce uvedete $$ , každý odpovídající sloupec se aktualizuje se stejným názvem. Hodnota každého sloupce je existující hodnota zaokrouhlená na dvě desetinná místa.

Pokud chcete ověřit správnost odpovídající podmínky, můžete ověřit výstupní schéma definovaných sloupců na kartě Kontrola nebo získat snímek dat na kartě Náhled dat.

Snímek obrazovky ukazuje kartu Výstupní schéma.

Porovnávání hierarchických vzorů

Můžete také vytvořit porovnávání vzorů uvnitř složitých hierarchických struktur. Rozbalte oddíl Each MoviesStruct that matches , ve kterém se zobrazí výzva pro každou hierarchii datového streamu. Pak můžete vytvořit odpovídající vzory pro vlastnosti v rámci zvolené hierarchie.

Snímek obrazovky znázorňující hierarchický vzor sloupce

Zploštěné konstrukce

Pokud vaše data obsahují složité struktury, jako jsou pole, hierarchické struktury a mapy, můžete pomocí transformace Flatten rozvinout pole a denormalizovat svá data. U struktur a map použijte odvozenou transformaci sloupců se vzory sloupců k vytvoření zploštěné relační tabulky z hierarchií. Můžete použít vzory sloupců, které by vypadaly jako v této ukázce, což zplošťuje geografickou hierarchii do formy relační tabulky.

Snímek obrazovky znázorňující zploštěnou strukturu odvozeného sloupce

Mapování na základě pravidel ve výběru a jímce

Při mapování sloupců ve zdroji a výběrových transformací můžete přidat buď pevné mapování, nebo mapování založená na pravidlech. Porovnává se na základě name, type, stream, origin a position sloupců. Můžete mít libovolnou kombinaci pevných mapování a mapování založených na pravidlech. Ve výchozím nastavení se ve všech projekcích s více než 50 sloupci automaticky použije mapování založené na pravidlech, které odpovídá každému sloupci a výstupem je zadaný název.

Chcete-li přidat mapování založené na pravidlech, klepněte na tlačítko Přidat mapování a vyberte mapování založené na pravidlech.

Snímek obrazovky znázorňující mapování založené na pravidlech vybrané z nabídky Přidat mapování

Každé mapování založené na pravidlech vyžaduje dva vstupy: podmínku, podle které se má shodovat, a název každého mapovaného sloupce. Obě hodnoty se zadávají prostřednictvím tvůrce výrazů. Do levého textového pole výrazu zadejte logickou podmínku shody. Do pravého pole výrazu zadejte, co odpovídajícímu sloupci přiřadit.

Snímek obrazovky ukazuje mapování.

Pomocí $$ syntaxe můžete odkazovat na vstupní název odpovídajícího sloupce. Když použijete výše uvedený obrázek jako příklad, předpokládejme, že uživatel chce sladit všechny sloupce s řetězci, jejichž názvy jsou kratší než šest znaků. Pokud byl pojmenován testjeden příchozí sloupec , výraz $$ + '_short' přejmenuje sloupec test_short. Pokud je to jediné mapování, které existuje, všechny sloupce, které nesplňují podmínku, se z výstupních dat zahodí.

Vzory odpovídají posunutým i definovaným sloupcům. Pokud chcete zjistit, které definované sloupce jsou mapovány pravidlem, klikněte na ikonu brýlí vedle pravidla. Ověřte výstup pomocí náhledu dat.

Mapování regulárních výrazů

Pokud kliknete na ikonu šipky dolů, můžete zadat podmínku mapování regulárních výrazů. Podmínka mapování regex odpovídá všem názvům sloupců, které se shodují se zadanou podmínkou regex. To lze použít v kombinaci se standardními mapováními založenými na pravidlech.

Snímek obrazovky znázorňuje podmínku mapování regulárních výrazů s úrovní v hierarchii a shodou názvů.

Výše uvedený příklad odpovídá vzoru regulárního výrazu (r) nebo libovolnému názvu sloupce, který obsahuje malé písmeno r. Podobně jako u standardního mapování založeného na pravidlech se všechny odpovídající sloupce mění podmínkou na pravé straně pomocí $$ syntaxe.

Hierarchie založené na pravidlech

Pokud má definovaná projekce hierarchii, můžete k mapování podsloupců hierarchií použít mapování založené na pravidlech. Zadejte odpovídající podmínku a složitý sloupec, jehož podsloupce chcete mapovat. Každý odpovídající podsloupec se vypíše pomocí pravidla „Name as“, které je uvedeno na pravé straně.

Snímek obrazovky ukazuje mapování založené na pravidlech, které se používá pro hierarchii.

Výše uvedený příklad odpovídá všem dílčím sloupcům komplexního sloupce a. a obsahuje dva podsloupce b a c. Výstupní schéma bude obsahovat dva sloupce b a c jako podmínku Name as je $$.

Hodnoty porovnávání vzorů výrazů

  • $$ překládá se na název nebo hodnotu každé shody během provádění. $$ Představte si, že je ekvivalentníthis
  • $0 se přeloží na shodu názvu aktuálního sloupce za běhu pro skalární typy. U hierarchických typů $0 představuje aktuální odpovídající cestu hierarchie sloupců.
  • name představuje název každého příchozího sloupce.
  • type představuje datový typ každého příchozího sloupce. Seznam datových typů v systému typů toků dat najdete tady.
  • stream představuje název přidružený ke každému datovému proudu nebo transformaci ve vašem toku.
  • position je pořadové umístění sloupců ve vašem toku dat.
  • origin je proces, kde sloupec vznikl nebo byl naposledy aktualizován.
  • Další informace o výrazovém jazyce pro mapování toků dat pro jejich transformace.
  • Použití vzorů sloupců v transformaci jímky a výběr transformace s mapováním založeným na pravidlech