Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Zdrojový kód kanálu Python můžete vytvořit ve svém upřednostňovaném integrovaném vývojovém prostředí (IDE), spustit ho místně pro testování, pak ověřit, nasadit a spouštět aktualizace v pracovním prostoru Azure Databricks bez opuštění místního prostředí.
Kanály Lakeflow jsou nadmnožinou deklarativních kanálů Apache Sparku™. Kód, který používá pouze rozhraní API Apache Spark Declarative Pipelines, běží lokálně i v Azure Databricks, ale kód, který používá funkce jedinečné pro kanály Lakeflow, například AUTO CDC a expectations, běží pouze v Azure Databricks. Rozdíly mezi funkcemi najdete v tématu Referenční příručka k jazyku Python pro kanály Lakeflow.
Pro interaktivní vývoj a testování v pracovním prostoru Azure Databricks použijte Editor kanálů Lakeflow. Viz Vývoj a ladění kanálů ETL pomocí Editoru kanálů Lakeflow.
Pište kód pipeline s podporou v IDE
Napište kód pipeline pomocí modulu pyspark.pipelines, importovaného jako dp:
from pyspark import pipelines as dp
Vzhledem k tomu, že je modul součástí Apache Sparku, poskytuje integrované vývojové prostředí při psaní kontrolu syntaxe, automatické dokončování a kontrolu typů. Kód deklarativních kanálů Apache Sparku se obvykle spouští bez úprav v Azure Databricks. Spuštění stejného příkazu pro import v pipeline Lakeflow naimportuje verzi pipelines pro Azure Databricks. Úplnou referenci jazyka Python pro kanály Lakeflow naleznete v dokumentu Referenční příručka jazyka Python pro kanály Lakeflow.
Spouštění pipeline lokálně pro testování
Kanály můžete také spouštět místně, abyste mohli vyvíjet a testovat kód, než ho spustíte na Azure Databricks. Použijte rozhraní příkazového řádku spark-pipelines k inicializaci, ověření a spuštění pipeline pomocí místního Apache Sparku. V dokumentaci k Apache Sparku najdete průvodce programováním deklarativních kanálů Sparku .
Funkce specifické pro kanály Lakeflow nejde spustit ani otestovat místně. To zahrnuje požadavky a AUTO CDC funkce.
Spouštění kanálů v Azure Databricks z místního prostředí
Pomocí skupiny příkazů databricks pipelines ověřte, nasaďte a spusťte aktualizace pipeline ve svém pracovním prostoru přímo v terminálu:
databricks pipelines init # scaffold a pipeline project
databricks pipelines dry-run # validate the pipeline graph without publishing data
databricks pipelines deploy # deploy the project to your workspace
databricks pipelines run # run an update
Aktualizace pipeline probíhají ve vašem pracovním prostoru Azure Databricks, ne na vašem místním počítači, s využitím výpočetních prostředků nakonfigurovaných pro pipeline. Tyto příkazy jsou kompatibilní s příkazy Declarative Automation Bundles bundle, takže můžete začít s jednoduchým projektem a s jeho růstem přejít na konfiguraci balíčků a postupy CI/CD. Informace o instalaci a konfiguraci rozhraní příkazového řádku najdete v tématu Instalace nebo aktualizace rozhraní příkazového řádku Databricks. Úplný odkaz na příkaz naleznete pipelines ve skupině příkazů. Podrobný postup najdete v článku Vytváření kanálů pomocí deklarativních balíčků automatizace.
Synchronizujte kód pipeline z integrovaného vývojového prostředí (IDE) do pracovního prostoru
Následující tabulka shrnuje možnosti synchronizace zdrojového kódu kanálu mezi místním prostředím IDE a pracovním prostorem Azure Databricks:
| Nástroj nebo vzor | Podrobnosti |
|---|---|
Databricks CLI (pipelines skupina příkazů) |
Pomocí příkazů databricks pipelines nasaďte a spusťte projekt pipeline ve vašem místním prostředí. Viz pipelines skupina příkazů. |
| Deklarativní balíčky automatizace | Balíčky deklarativní automatizace slouží k nasazení prostředků kanálu v rozsahu složitosti od jednoho souboru zdrojového kódu až po konfigurace pro více kanálů, úloh a souborů zdrojového kódu. Viz Převod pipeliny na projekt balíčku. |
| Databricks IDE rozšíření | Azure Databricks poskytuje integraci s Visual Studio Code, která zahrnuje snadnou synchronizaci mezi místním prostředím IDE a soubory pracovního prostoru. Toto rozšíření také poskytuje nástroje pro použití deklarativních automatizačních balíčků k nasazení aktiv kanálů. Viz rozšíření IDE Databricks. |
| Soubory pracovního prostoru | Soubory pracovního prostoru Databricks můžete použít k nahrání zdrojového kódu kanálu do pracovního prostoru Databricks a následnému importu kódu do kanálu. Podívejte se na co jsou soubory pracovního prostoru. |
| Složky Gitu | Složky Git umožňují synchronizovat kód mezi místním prostředím a pracovním prostorem Azure Databricks pomocí úložiště Git jako zprostředkujícího. Viz složky Git Azure Databricks. |