Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
VZTAHUJE SE NA:
Azure Data Factory
Azure Synapse Analytics
Tip
Pro ekvivalentní aktivitu v Data Factory v Microsoft Fabric viz aktivita Azure Databricks.
Aktivita Azure Databricks Jar v pipeline spouští Spark Jar ve vašem clusteru Azure Databricks. Tento článek vychází z článku o aktivitách transformace dat, který představuje obecný přehled transformace dat a podporovaných transformačních aktivit. Azure Databricks je spravovaná platforma pro spouštění Apache Sparku.
Jedenáctiminutové představení a ukázku této funkce najdete v tomto videu:
Přidání aktivity Jar pro Azure Databricks do potrubí pomocí uživatelského rozhraní
Pokud chcete použít aktivitu Jar pro Azure Databricks v datovém toku, proveďte následující kroky:
Vyhledejte Jar v panelu činností kanálu a přetáhněte aktivitu Jar do plátna kanálu.
Vyberte novou aktivitu Jar na plátně, pokud ještě není vybraná.
Vyberte kartu Azure Databricks a vyberte nebo vytvořte novou propojenou službu Azure Databricks, která spustí aktivitu Jar.
Vyberte kartu Settings a zadejte název třídy, který se má spustit na Azure Databricks, volitelné parametry, které se mají předat do souboru Jar, a knihovny, které se mají nainstalovat do clusteru, aby se úloha spustila.
Definice aktivity Databricks Jar
Tady je ukázková definice JSON aktivity Databricks Jar.
{
"name": "SparkJarActivity",
"type": "DatabricksSparkJar",
"linkedServiceName": {
"referenceName": "AzureDatabricks",
"type": "LinkedServiceReference"
},
"typeProperties": {
"mainClassName": "org.apache.spark.examples.SparkPi",
"parameters": [ "10" ],
"libraries": [
{
"jar": "dbfs:/docs/sparkpi.jar"
}
]
}
}
Vlastnosti aktivity Jar databricks
Následující tabulka popisuje vlastnosti JSON použité v definici JSON:
| Vlastnost | Popis | Povinné |
|---|---|---|
| název | Název aktivity v potrubí. | Ano |
| popis | Text popisující, co aktivita dělá. | Ne |
| typ | Pro aktivitu Databricks Jar je typ aktivity DatabricksSparkJar. | Ano |
| názevPrepojenéSlužby | Název propojené služby Databricks, na které se aktivita Jar spouští. Další informace o této propojené službě najdete v článku o propojených službách Compute. | Ano |
| mainClassName | Úplný název třídy obsahující hlavní metodu, která se má provést. Tato třída musí být obsažena v souboru JAR poskytnutého jako knihovna. Soubor JAR může obsahovat více tříd. Každá z tříd může obsahovat hlavní metodu. | Ano |
| parametry | Parametry, které se předají hlavní metodě. Tato vlastnost je pole řetězců. | Ne |
| knihovny | Seznam knihoven, které se mají nainstalovat do clusteru, který spustí úlohu. Může to být pole řetězců nebo objektů |
Ano (alespoň jeden obsahující metodu mainClassName) |
Poznámka:
Známý problém – při použití stejného interaktivního clusteru pro spouštění souběžných aktivit Databricks Jar (bez restartování clusteru) existuje známý problém v Databricks, kdy se parametry první aktivity budou používat také následujícími aktivitami. Výsledkem je předání nesprávných parametrů následným úlohům. Pokud chcete tento problém zmírnit, použijte raději Job cluster.
Podporované knihovny pro aktivity Databricks
V předchozí definici aktivity Databricks jste zadali tyto typy knihoven: jar, egg, maven, pypi, cran.
{
"libraries": [
{
"jar": "dbfs:/mnt/libraries/library.jar"
},
{
"egg": "dbfs:/mnt/libraries/library.egg"
},
{
"maven": {
"coordinates": "org.jsoup:jsoup:1.7.2",
"exclusions": [ "slf4j:slf4j" ]
}
},
{
"pypi": {
"package": "simplejson",
"repo": "http://my-pypi-mirror.com"
}
},
{
"cran": {
"package": "ada",
"repo": "https://cran.us.r-project.org"
}
}
]
}
Další informace najdete v dokumentaci k Databricks pro typy knihoven.
Jak nahrát knihovnu v Databricks
Můžete použít uživatelské rozhraní pracovního prostoru:
Použití uživatelského rozhraní pracovního prostoru Databricks
K získání cesty dbfs knihovny přidané pomocí uživatelského rozhraní můžete použít Rozhraní příkazového řádku Databricks.
Knihovny Jar se obvykle ukládají v souboru dbfs:/FileStore/jars při používání uživatelského rozhraní. Můžete vypsat všechny prostřednictvím příkazového řádku (CLI): databricks fs ls dbfs:/FileStore/job-jars
Nebo můžete použít rozhraní příkazového řádku Databricks:
Postupujte podle pokynů ke kopírování knihovny pomocí rozhraní příkazového řádku Databricks.
Použijte Databricks CLI (kroky instalace)
Například zkopírování souboru JAR do dbfs:
dbfs cp SparkPi-assembly-0.1.jar dbfs:/docs/sparkpi.jar
Související obsah
Na jedenáctminutový úvod a ukázku této funkce se podívejte na video.