Přesuňte soubor vizuální přípravy dat do produkčního prostředí

Každý soubor přípravy vizuálních dat, který sestavíte v Návrháři Lakeflow, je založený na kódu připraveném pro produkční prostředí a uloží se jako poznámkový blok s názvem <name>.designer.ipynb. Můžete ho přesunout do produkčního prostředí pomocí stejných nástrojů, které používáte pro další Azure Databricks kód: uložte ho v Gitu, spusťte ho jako úlohu a nasaďte ho pomocí deklarativních sad automation.

Tato stránka vysvětluje, jak vytvořit soubor přípravy vizuálních dat z prototypu do produkčního prostředí.

Ukládání a verze v Gitu

Pracovní prostor ukládá nativně soubory přípravy vizuálních dat. Chcete-li verzovat soubor vizuální přípravy dat, umístěte jej do složky Git a sledujte změny v něm stejně jako u jakéhokoli jiného poznámkového bloku:

  1. Ve svém pracovním prostoru vytvořte složku Git.
  2. Přesuňte soubor pro vizuální přípravu dat do té složky Git.
  3. Sledujte soubor, vytvářejte commity a verzujte ho stejně jako jakýkoli jiný notebook v Gitu. V Gitu se soubor zobrazí jako <file_name>.designer.ipynb.

Další informace o složkách Gitu najdete v tématu Složky Gitu v Azure Databricks. Chcete-li exportovat nebo importovat soubor vizuální přípravy dat, viz Export a import souboru vizuální přípravy dat.

Naplánovat jako úlohu

Soubor pro vizuální přípravu dat můžete zautomatizovat jeho naplánováním jako úlohy.

  • Naplánujte přímo: Kliknutím na tlačítko Naplánovat v horním menu vytvoříte naplánovanou úlohu pro soubor vizuální přípravy dat.
  • Přidat do úlohy: Vytvořte úlohu Azure Databricks a přidejte soubor pro vizuální přípravu dat jako úkol. To vám umožní zkombinovat tento soubor pro vizuální přípravu dat s dalšími úkoly v rámci rozsáhlejšího procesu. V rozevírací nabídce Typ u úlohy vyberte Vizuální příprava dat a potom vyberte soubor.

Naplánované běhy zobrazují každý operátor jako samostatný uzel v grafu úloh, takže můžete v běhu zkoumat výsledky jednotlivých operátorů stejně jako na plátně.

Chcete-li zobrazit a spravovat existující plány, kliknutím na tlačítko Plán znovu otevřete seznam. Chcete-li vytvořit jiný plán , nebo otevřete ikonu nabídky Kebab plánu. Nabídka kebabu umožňuje upravit, spustit nyní, pozastavit, klonovat, zobrazit v úlohách nebo odstranit .

Zobrazit výstup operátoru během běhu

Ve výchozím nastavení naplánované spuštění generuje výstup pouze pro operátory terminálu (operátory bez podřízeného připojení), například výstupní operátor. Chcete-li zobrazit výsledky každého operátoru v rámci spuštění, rozbalte v dialogovém okně plánování Pokročilá nastavení a vyberte možnost Zobrazit výstup operátoru.

Ovládací prvek LFD Schedule pro automatizaci souboru vizuální přípravy dat jako úlohy.

Tuto možnost u velkých pláten vypněte, abyste se vyhnuli překročení limitu velikosti výstupu běhu.

Výběr bezserverového prostředí

Při práci se souborem pro vizuální přípravu dat můžete vybrat bezserverové prostředí používané pro interaktivní běhy i naplánované úlohy. Nakonfigurujte ho z ikony Prostředí.Boční podokno prostředí na pravém bočním panelu, stejně jako u poznámkového bloku. V části Základní prostředí vyberte verzi prostředí. Viz Konfigurace bezserverového prostředí.

Parametrizace napříč prostředími

Parametry jsou pojmenované hodnoty definované pro soubor pro vizuální přípravu dat jako celek, na které se můžete odkazovat v operátorech SQL a Python. Podrobnosti o definování a odkazování parametrů najdete v tématu Parametry.

Parametry umožňují spustit stejný soubor přípravy vizuálních dat v různých prostředích, například katalog testů během vývoje a produkčního katalogu v produkčním prostředí.

  • Při plánování úlohy v uživatelském rozhraní: Přepište hodnoty parametrů pro každý plán. Můžete například vytvořit jeden plán, který se spustí s parametrem environment nastaveným na test, a druhý, který se spustí s tímto parametrem nastaveným na production.
  • Při nasazování pomocí sady: Nastavte hodnoty parametrů prostřednictvím úlohy parametersa použijte cíle sady k zadání různých hodnot pro každé prostředí. Sady vývojových a produkčních cílů umožňují nasadit stejnou úlohu do samostatných prostředí s nastavením specifickými pro prostředí. Viz režimy nasazení deklarativních balíčků automatizace a konfiguraci deklarativních balíčků automatizace.

Při spuštění soubor vizuální přípravy dat načítá své parametry stejným způsobem, ať už běží interaktivně, nebo jako úloha, takže stejný soubor funguje napříč všemi vašimi prostředími bez úprav.

Číst z různých tabulek pro každé prostředí

Pokud chcete číst z jiné zdrojové tabulky v každém prostředí, použijte operátor SQL s parametry místo pevného operátoru Source. Definujte parametry catalog, schema a table a pak na ně odkazujte pomocí klauzule IDENTIFIER() k dynamickému sestavení názvu tabulky:

SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)

Přepište parametry catalog, schema nebo table pro každý plán nebo cíl sady tak, aby stejný soubor vizuální přípravy dat odkazoval během vývoje na testovací data a v produkčním prostředí na produkční data. Více informací o doložce IDENTIFIER() naleznete v IDENTIFIER doložce.

Nasazení s využitím deklarativních balíčků automatizace

Deklarativní balíčky automatizace umožňují definovat a nasazovat Azure Databricks prostředky, jako jsou úlohy jako zdrojové soubory, abyste mohli použít osvědčené postupy pro softwarové inženýrství, jako je správa zdrojového kódu, kontrola kódu, testování a CI/CD, do souborů přípravy vizuálních dat. Viz Co jsou balíčky deklarativní automatizace?

Chcete-li nasadit soubor pro vizuální přípravu dat pomocí balíčku, definujte úlohu notebooku a zadejte cestu k souboru .designer.ipynb do notebook_task.notebook_path. V balíčku používá soubor vizuální přípravy dat klíč notebook_task, i když jej uživatelské rozhraní Joby zobrazuje jako typ úlohy Vizuální příprava dat.

Následující příklad definuje úlohu, která spustí soubor přípravy vizuálních dat umístěný vedle konfiguračního souboru sady:

resources:
  jobs:
    daily_prep_job:
      name: daily_prep_job
      tasks:
        - task_key: run_visual_data_prep
          notebook_task:
            notebook_path: ./my_transformation.designer.ipynb

Nasaďte a spusťte sadu pomocí rozhraní příkazového řádku Azure Databricks:

databricks bundle deploy
databricks bundle run daily_prep_job

Úplnou sadu klíčů úkolů poznámkového bloku najdete v tématu Úkol poznámkového bloku. Úplný návod k definování úlohy v sadě najdete v tématu Vývoj úlohy pomocí deklarativních automatizačních sad.

Automatizace pomocí CI/CD

Pokud chcete balíčky přípravy vizuálních dat ověřit a nasadit automaticky, integrujte je do kanálu CI/CD. Příklad použití GitHub Actions najdete v tématu GitHub Actions.

Další prostředky