Předdefinované operátory v Návrháři Lakeflow

Návrhář Lakeflow obsahuje integrované operátory pro běžné úlohy přípravy a transformace dat. Otevřete nabídku operátoru v bočním podokně na levé straně a procházejte operátory podle kategorií nebo použijte funkci Hledat operátora... v horní části podokna. Hledání operátorů navrhuje operátory na základě vašeho záměru. Například při average by month psaní se vrátí operátor Agregace . Pokud chcete po přidání na plátno otevřít podokno konfigurace operátora, poklikejte na něj nebo podržte ukazatel myši a klikněte na ikonu Tužka. (Operátor pro úpravy).

Každý operátor zobrazí popis toho, co dělá, aI vygenerovaný pomocí umělé inteligence. Popis také funguje jako editor pro operátor: Úprava popisu rekonfiguruje operátor tak, aby odpovídal vašemu popisu.

Informace o vytváření vlastních uživatelem definovaných operátorů najdete v tématu Uživatelem definované operátory v Návrháři Lakeflow.

Zdroj a výstup

Source

Importuje data do Návrháře. Operátor Zdroj čte z tabulky katalogu Unity nebo z jiných podporovaných zdrojů. Má dvě fáze:

  1. Výběr tabulky nebo souboru: Vyhledejte tabulku nebo soubor podle názvu nebo procházejte podle katalogu a schématu. Můžete také vytvořit novou tabulku z tohoto podokna.
  2. Souhrn tabulky: Po výběru tabulky se v podokně konfigurace zobrazí jméno, vlastník tabulky a čas poslední aktualizace. Chcete-li změnit zdroj, klikněte na vybrat nový zdroj dat . Změna zdroje zneplatní výstupní mezipaměť pro všechny podřízené operátory.

Úplný rozsah možností příjmu dat najdete v tématu Ingestování dat do Návrháře Lakeflow.

Výstup

Exportuje data z Návrháře zápisem výsledků do tabulky v katalogu Unity.

V podokně Konfigurace výstupu zadejte:

  • Název tabulky: Název tabulky, která se má vytvořit.
  • Umístění výstupu: Katalog a schéma, ve kterém je tabulka vytvořena.

Kliknutím na Spustit spustíte přípravu dat vizuálu a zapíšete výsledky.

Každé spuštění zapíše spravovanou tabulku katalogu Unity. Pokud tabulka neexistuje, operátor ji vytvoří. pokud ano, spuštění nahradí jeho obsah. Naplánovaná spuštění nahradí tabulku stejným způsobem, takže výstup bude odrážet poslední spuštění, nikoli přidávat řádky.

Funkce AI

Spustí integrovanou operaci AI na vašich datech. V podokně konfigurace otevřete možnost Vybrat funkci a zvolte některou z níže uvedených funkcí. Každá funkce zveřejňuje možnosti v podokně pro vstupy (například sloupce, výzvy, popisky nebo jazyky) a výstupy.

Podrobnosti o jednotlivých funkcích najdete v tématu Rozšiřování dat pomocí funkcí AI.

Function Description
ai_analyze_sentiment Provede analýzu mínění u vstupního textu.
ai_classify Klasifikuje text nebo parsované dokumenty pomocí popisků, které zadáte.
ai_extract Extrahuje strukturovaná data z textu nebo parsovaných dokumentů pomocí definovaných polí.
ai_fix_grammar Opraví gramatické chyby v textu.
ai_gen Odpoví na výzvu poskytovanou uživatelem vůči vstupu.
ai_mask Masky zadané entity v textu (například pro de-identifikaci).
ai_similarity Porovná dva řetězce a vrátí sémantické skóre podobnosti.
ai_summarize Vygeneruje souhrn textu.
ai_translate Převede text do cílového jazyka, který zadáte.

Transformations

Následující operátory provádějí transformace vašich dat.

Aggregate

Shrnuje řádky seskupením dat a výpočetními agregovanými hodnotami.

  • Agregace podle: Vyberte sloupec, zvolte agregační funkci a zadejte název výstupního sloupce. Pokud chcete přidat další, klikněte na + Přidat agregaci .
  • Seskupit podle: Vyberte sloupce, podle kterých chcete sloupce seskupit. Pokud chcete přidat další, klikněte na + Přidat seskupení .

Podporované agregační funkce: AVG, COUNT, MAX, MEAN, MEDIAN, MIN, PERCENTIL, STDDEV, SUM, VARIANCE.

Note

Sloupce používané ve skupině se automaticky zahrnou do výstupu.

Kombinovat

Sloučí data z více tabulek s odpovídajícími schématy do jednoho výstupu.

  • Operace nastavení: Zvolte sjednocovací, protínající nebo s výjimkou.
  • Strategie sloučení: Chcete-li vyloučit duplicitní řádky z výstupu, nebo chcete-li zachovat všechny řádky včetně duplicit.

Filtr

Vybere odpovídající řádky tak, že zachová jenom řádky, které splňují jednu nebo více podmínek, pomocí grafického tvůrce podmínek. Pro každou podmínku vyberte sloupec, typ podmínky a hodnotu , která se má podmíněně shodovat.

Podporované typy podmínek:

  • Rovná se / Není rovno
  • Je jedním z / Není jedním z
  • Obsahuje / Neobsahuje
  • Začíná na / Nezačíná na
  • Končí na / Nekončí na
  • Větší než / Menší než
  • Is null / Is not null

Připojte se

Propojování dvou tabulek na klíč kombinací dvou vstupních datových sad na základě odpovídajících hodnot sloupců.

Konfigurace připojení:

  1. Vyberte dvě vstupní tabulky, které chcete spojit.
  2. Zadejte alespoň jednu podmínku spojení výběrem odpovídajících sloupců ze dvou tabulek. Kliknutím na + Přidat výraz spojení přidejte další podmínky.
  3. Volitelné: Přidejte vlastní podmínku spojení kliknutím na šipku mezi tabulkami vlevo a vpravo. Upravte popis vygenerovaný pomocí AI nebo zapište SQL tak, aby konfiguroval podmínku.
  4. Vyberte typ spojení: Úplné spojení, Vnitřní spojení, Levé spojení nebo Pravé spojení.
  5. Volitelné: Vyberte sloupce, které chcete zahrnout do výstupu. Ve výchozím nastavení jsou zahrnuty všechny sloupce z obou tabulek. Duplicitní názvy sloupců obdrží předponu názvu tabulky.
  6. Volitelné: Přidejte sloupce vlastních výrazů na základě spojeného výsledku.

Omezení

Omezí počet řádků tak, že projde jenom maximální počet zadaných řádků.

Pivot

Přetváření tabulkových dat ve dvou směrech. Pomocí karet v horní části podokna konfigurace zvolte režim:

  • Řádky → Sloupce (pivot): Zaměňte jedinečné hodnoty v jednom sloupci na záhlaví nových sloupců a tyto sloupce vyplňte agregovanými hodnotami z jiného sloupce.
  • Sloupce → řádky (unpivot): Přeložte jeden nebo více sloupců do řádků; set names for the output key and value columns.

V režimu řádků → sloupců :

  • Kontingenční sloupec: Vyberte sloupec, jehož jedinečné hodnoty se stanou novými záhlavími.
  • Hodnota a agregace: Zvolte sloupec, jehož hodnoty vyplňují kontingenční buňky, a vyberte agregační funkci (například SUMA, AVG, COUNT, MIN nebo MAX). Nakonfigurujte způsob zpracování chybějících hodnot (například null nebo nula), pokud jsou v podokně k dispozici.

V režimu Sloupce → Řádky vyberte sloupce, které chcete převést na řádky, a nakonfigurujte názvy sloupců výstupního klíče a hodnoty.

Zahrnout sloupce: Pomocí tabulky můžete zvolit, které sloupce zůstanou ve výstupu spolu s kontingenčními nebo nepřekontovanými hodnotami (a k vyřazení sloupců, které před transformací nepotřebujete). Návrhář odvodí pevné (seskupené) sloupce ze sloupců, které nepřiřazujete k kontingenčním rolím, hodnotám nebo zrušením převodu.

Sort

Objednává řádky na jednom nebo více sloupcích. Pro každý sloupec zvolte ASC (vzestupně) nebo DESC (sestupně). Kliknutím na + Přidat výraz řazení seřadíte podle dalších sloupců. Řazení se řídí standardním lexikálním pořadím.

SQL

Zapíše vlastní kód SQL pro všechny transformace, které ostatní operátory nepokrýjí.

Do editoru zadejte příkaz SQL SELECT . Pokud chcete odkazovat na výstup vstupního operátoru, použijte název tohoto operátoru jako název tabulky v dotazu. Například:

SELECT COUNT(*)
FROM aggregate_2
WHERE 1 = 1

Klikněte na ikonu Kód. V editoru otevřete celé podokno kódu SQL a podívejte se, jak váš příkaz zapadá do celého pracovního postupu.

Pokud chcete odkazovat na parametr přípravy vizuálních dat, použijte syntaxi pojmenované značky parametru, například :environment. Když otevřete operátor pro úpravy, Návrhář zobrazí příklad nad editorem. Viz parametry.

Přeměna

Vybere, vytvoří nebo transformuje sloupce ze vstupních dat.

V podokně konfigurace transformace:

  • Zahrnout nebo vyloučit sloupce: Pomocí zaškrtávacích políček vyberte, které sloupce procházejí do výstupu. Kliknutím na zaškrtávací políčko záhlaví vyberte všechny sloupce nebo výběr zrušte.
  • Přejmenovat sloupec: Do pole Přejmenovat vedle libovolného sloupce zadejte nový název.
  • Změnit pořadí sloupců: Přetažením úchytu na levé straně řádku změňte pořadí sloupců.
  • Přidání vlastního sloupce: Kliknutím na + Přidat vlastní sloupec otevřete editor výrazů. Viz níže.

Vlastní sloupce

Editor výrazů umožňuje definovat nové sloupce pomocí přirozeného jazyka nebo kódu. Editor má dvě vstupní pole a je obousměrný:

  • Popis: Zadejte popis přirozeného jazyka, který má sloupec udělat. Návrhář používá Genie k vygenerování odpovídajícího výrazu kódu níže.
  • Výraz: Pokud chcete psát nebo upravovat kód přímo, klikněte na tlačítko upravit výraz. Úprava výrazu automaticky vygeneruje popis přirozeného jazyka.

Pokud chcete odebrat vlastní sloupec, podržte ukazatel myši nad jeho řádkem a klikněte na ikonu Pomlčka.

Python

Spustí vlastní Python (PySpark) na vstupních datech. Váš kód přijímá upstreamové datové sady jako datové rámce Sparku a musí přiřadit jeden datový rámec result, který se stane výstupem tohoto operátoru. Pomocí konfiguračního podokna můžete připojit vstupy a zkontrolovat všechny možnosti, které editor poskytuje.

inputs["data"] je seznam vstupních datových rámců v upstreamovém pořadí. V podokně podrobností operátoru se zobrazují názvy jednotlivých vstupů v pořadí. Například: Available inputs: inputs["data"][0] (customers), inputs["Data"][1] (sales).

Minimálním vzorem je použití prvního vstupu, pokud je k dispozici, nebo prázdného datového rámce v opačném případě:

# inputs["data"] is a list of input DataFrames

result = inputs["data"][0] if inputs["data"] else spark.createDataFrame([], "col: string")

Odtud můžete zřetězovat operace datového rámce (například select, filter, withColumn, nebo spojení) před result koncem přiřazení nebo nahradit result novým datovým rámcem sestaveným z inputs["data"].

Pokud chcete odkazovat na parametr přípravy vizuálních dat, zavolejte dbutils.widgets.get()například dbutils.widgets.get("environment"). Když otevřete operátor pro úpravy, Návrhář zobrazí příklad nad editorem. Viz parametry.

Organizace

Note

Přidá na plátno poznámku, abyste mohli dokumentovat samotný pracovní postup: jeho účel, předpoklady, upozornění nebo kontext předání pro každého, kdo později otevře přípravu vizuálních dat. Obsah poznámek podporuje Markdown, takže můžete použít nadpisy, seznamy, odkazy a zdůraznění, pokud prostý text nestačí. Poznámky nemají vliv na to, jak data procházejí operátory.

Group

Vizuálně seskupují operátory na plátně beze změny způsobu toku dat mezi nimi, což je užitečné, když se příprava vizuálních dat rozrůstá nebo chcete odrážet logické fáze.

Vytvoření skupiny:

  • Přetáhněte operátory do skupiny: Přetažením jednoho nebo více operátorů do skupiny je přidáte do skupiny.
  • Vytvořte skupinu z výběru: Vyberte jeden nebo více operátorů, otevřete místní nabídku (klikněte pravým tlačítkem) a výběrem možnosti Vytvořit novou skupinu zabalte výběr do nové skupiny.

Jakmile jsou operátory ve skupině, můžete skupině dát popisný název a minimalizovat nebo ho rozbalit , aby se zobrazil nebo skryl jeho obsah na plátně.

Další prostředky