Transformace dat spuštěním aktivity Jar v Azure Databricks

VZTAHUJE SE NA: Azure Data Factory Azure Synapse Analytics

Tip

Pro ekvivalentní aktivitu v Data Factory v Microsoft Fabric viz aktivita Azure Databricks.

Aktivita Azure Databricks Jar v pipeline spouští Spark Jar ve vašem clusteru Azure Databricks. Tento článek vychází z článku o aktivitách transformace dat, který představuje obecný přehled transformace dat a podporovaných transformačních aktivit. Azure Databricks je spravovaná platforma pro spouštění Apache Sparku.

Jedenáctiminutové představení a ukázku této funkce najdete v tomto videu:

Přidání aktivity Jar pro Azure Databricks do potrubí pomocí uživatelského rozhraní

Pokud chcete použít aktivitu Jar pro Azure Databricks v datovém toku, proveďte následující kroky:

  1. Vyhledejte Jar v panelu činností kanálu a přetáhněte aktivitu Jar do plátna kanálu.

  2. Vyberte novou aktivitu Jar na plátně, pokud ještě není vybraná.

  3. Vyberte kartu Azure Databricks a vyberte nebo vytvořte novou propojenou službu Azure Databricks, která spustí aktivitu Jar.

    Zobrazuje uživatelské rozhraní pro aktivitu Jar.

  4. Vyberte kartu Settings a zadejte název třídy, který se má spustit na Azure Databricks, volitelné parametry, které se mají předat do souboru Jar, a knihovny, které se mají nainstalovat do clusteru, aby se úloha spustila.

    Zobrazuje uživatelské rozhraní pro kartu Nastavení aktivity Jar.

Definice aktivity Databricks Jar

Tady je ukázková definice JSON aktivity Databricks Jar.

{
    "name": "SparkJarActivity",
    "type": "DatabricksSparkJar",
    "linkedServiceName": {
        "referenceName": "AzureDatabricks",
        "type": "LinkedServiceReference"
    },
    "typeProperties": {
        "mainClassName": "org.apache.spark.examples.SparkPi",
        "parameters": [ "10" ],
        "libraries": [
            {
                "jar": "dbfs:/docs/sparkpi.jar"
            }
        ]
    }
}

Vlastnosti aktivity Jar databricks

Následující tabulka popisuje vlastnosti JSON použité v definici JSON:

Vlastnost Popis Povinné
název Název aktivity v potrubí. Ano
popis Text popisující, co aktivita dělá. Ne
typ Pro aktivitu Databricks Jar je typ aktivity DatabricksSparkJar. Ano
názevPrepojenéSlužby Název propojené služby Databricks, na které se aktivita Jar spouští. Další informace o této propojené službě najdete v článku o propojených službách Compute. Ano
mainClassName Úplný název třídy obsahující hlavní metodu, která se má provést. Tato třída musí být obsažena v souboru JAR poskytnutého jako knihovna. Soubor JAR může obsahovat více tříd. Každá z tříd může obsahovat hlavní metodu. Ano
parametry Parametry, které se předají hlavní metodě. Tato vlastnost je pole řetězců. Ne
knihovny Seznam knihoven, které se mají nainstalovat do clusteru, který spustí úlohu. Může to být pole řetězců nebo objektů . Ano (alespoň jeden obsahující metodu mainClassName)

Poznámka:

Známý problém – při použití stejného interaktivního clusteru pro spouštění souběžných aktivit Databricks Jar (bez restartování clusteru) existuje známý problém v Databricks, kdy se parametry první aktivity budou používat také následujícími aktivitami. Výsledkem je předání nesprávných parametrů následným úlohům. Pokud chcete tento problém zmírnit, použijte raději Job cluster.

Podporované knihovny pro aktivity Databricks

V předchozí definici aktivity Databricks jste zadali tyto typy knihoven: jar, egg, maven, pypi, cran.

{
    "libraries": [
        {
            "jar": "dbfs:/mnt/libraries/library.jar"
        },
        {
            "egg": "dbfs:/mnt/libraries/library.egg"
        },
        {
            "maven": {
                "coordinates": "org.jsoup:jsoup:1.7.2",
                "exclusions": [ "slf4j:slf4j" ]
            }
        },
        {
            "pypi": {
                "package": "simplejson",
                "repo": "http://my-pypi-mirror.com"
            }
        },
        {
            "cran": {
                "package": "ada",
                "repo": "https://cran.us.r-project.org"
            }
        }
    ]
}

Další informace najdete v dokumentaci k Databricks pro typy knihoven.

Jak nahrát knihovnu v Databricks

Můžete použít uživatelské rozhraní pracovního prostoru:

  1. Použití uživatelského rozhraní pracovního prostoru Databricks

  2. K získání cesty dbfs knihovny přidané pomocí uživatelského rozhraní můžete použít Rozhraní příkazového řádku Databricks.

    Knihovny Jar se obvykle ukládají v souboru dbfs:/FileStore/jars při používání uživatelského rozhraní. Můžete vypsat všechny prostřednictvím příkazového řádku (CLI): databricks fs ls dbfs:/FileStore/job-jars

Nebo můžete použít rozhraní příkazového řádku Databricks:

  1. Postupujte podle pokynů ke kopírování knihovny pomocí rozhraní příkazového řádku Databricks.

  2. Použijte Databricks CLI (kroky instalace)

    Například zkopírování souboru JAR do dbfs: dbfs cp SparkPi-assembly-0.1.jar dbfs:/docs/sparkpi.jar

Na jedenáctminutový úvod a ukázku této funkce se podívejte na video.