Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
A Lakeflow Jobs a Azure Databricks munkafolyamat-automatizálása, amely vezénylést biztosít az adatfeldolgozási számítási feladatokhoz, így több feladatot koordinálhat és futtathat egy nagyobb munkafolyamat részeként. Optimalizálhatja és ütemezheti a gyakori, megismételhető feladatok végrehajtását, és kezelheti az összetett munkafolyamatokat.
Mik azok a feladatok?
A Databricksben egy munka segítségével ütemezheti és irányíthatja a feladatokat egy munkafolyamatban. A gyakori adatfeldolgozási munkafolyamatok közé tartoznak az ETL-munkafolyamatok, a futó jegyzetfüzetek és a gépi tanulási (ML-) munkafolyamatok, valamint az olyan külső rendszerekkel való integráció, mint a DBT és a Azure Data Factory (ADF).
A munkák egy vagy több feladatból állnak, és támogatják az egyéni vezérlési folyamatos logikát, például az elágazást (if/else utasítások) vagy a ciklust (for each utasítások) egy vizuális szerkesztő felület használatával. A feladatok betölthetnek vagy átalakíthatnak adatokat egy ETL-munkafolyamatban, vagy gépi tanulási folyamatok részeként szabályozott és megismételhető módon hozhatnak létre, taníthatnak be és helyezhetnek üzembe ML-modelleket.
Példa: Napi adatfeldolgozási és érvényesítési feladat
Az alábbi példában egy feladat látható Azure Databricks.
Ez a példafeladat a következő jellemzőkkel rendelkezik:
- Az első feladat feldolgozza a bevételi adatokat.
- A második feladat egy ha / különben ellenőrzés nulla értékek esetén.
- Ha nem, akkor egy átalakítási feladat fut.
- Ellenkező esetben egy jegyzetfüzet-feladatot futtat adatminőség-ellenőrzéssel.
- Az ütemezés szerint minden nap ugyanabban az időben fut.
Ha gyorsan szeretne megismerkedni a saját feladat létrehozásával, olvassa el az első munkafolyamat létrehozása a Lakeflow-feladatok használatával című témakört.
Orchestációs fogalmak
A Lakeflow-feladatok vezénylésre való használata három fő fogalomból áll a Azure Databricks: feladatok, feladatok és eseményindítók.
Feladat – A feladatok a műveletek összehangolásának, ütemezésének és futtatásának elsődleges erőforrásai. A feladatok összetettsége eltérő lehet egy Azure Databricks jegyzetfüzetet futtató tevékenységtől a feltételes logikával és függőségekkel rendelkező tevékenységek százaiig. A feladatokat egy irányított aciklikus gráf (DAG) ábrázolja vizuálisan. Megadhatja a feladat tulajdonságait, többek között a következőket:
- Trigger – ez határozza meg, hogy mikor kell futtatni a feladatot.
- Paraméterek – futásidejű paraméterek, amelyeket a rendszer automatikusan leküld a feladaton belüli tevékenységekbe.
- Értesítések – e-maileket vagy webhookokat kell küldeni, ha egy feladat meghiúsul vagy túl sokáig tart.
- Git – a feladatfeladatok forrásvezérlési beállításai.
Tevékenység – A tevékenység egy adott munkaegység egy feladaton belül. Minden tevékenység többféle műveletet hajthat végre, többek között a következőket:
- Egy jegyzetfüzet-feladat egy Databricks-jegyzetfüzetet futtat. Megadhatja a jegyzetfüzet elérési útját és a szükséges paramétereket.
- Egy csővezeték-feladat futtat egy csővezetéket. Megadhatja a meglévő Lakeflow-folyamatokat, például egy materializált nézetet vagy egy streaming táblát.
- Egy Python szkriptfeladat egy Python fájlt futtat. Megadja a fájl elérési útját és a szükséges paramétereket.
A feladatoknak számos típusa van. A teljes listát Tevékenységek típusaicímű témakörben találja. A tevékenységek függőségekkel rendelkezhetnek más tevékenységekhez, és feltételesen futtathatnak más tevékenységeket, így összetett munkafolyamatokat hozhat létre feltételes logikával és függőségekkel.
Trigger – Az eseményindító olyan mechanizmus, amely meghatározott feltételek vagy események alapján kezdeményezi a feladat futtatását. Az eseményindító lehet időalapú, például egy feladat ütemezett időpontban történő futtatása (például minden nap 2:00-kor), vagy eseményalapú, például egy feladat futtatása, amikor új adatok érkeznek a felhőtárolóba.
Monitorozás és megfigyelhetőség
A feladatok beépített támogatást nyújtanak a monitorozáshoz és a megfigyelhetőséghez. Az alábbi témakörök áttekintést nyújtanak erről a támogatásról. A feladatok monitorozásáról és a vezénylésről további információt a Lakeflow-feladatok monitorozása című témakörben talál.
Feladatok monitorozása és megfigyelhetősége a felhasználói felületen – A Azure Databricks felhasználói felületén megtekintheti a feladatokat, például a feladat tulajdonosát és az utolsó futtatás eredményét, és szűrhet feladattulajdonságok szerint. Megtekintheti a munkamenetek végrehajtásainak előzményeit, és részletes információkat kaphat a munkafolyamatban lévő egyes feladatokról.
Feladatfuttatás állapota és metrikái – A Databricks a feladatok sikeres futtatásáról, valamint a feladatokon belüli tevékenységek naplóiról és metrikáiról számol be a problémák diagnosztizálásához és a teljesítmény megértéséhez.
Értesítések és riasztások – A feladateseményekre vonatkozó értesítéseket e-mailben, a Slackben, az egyéni webhookokban és számos egyéb beállításban állíthatja be.
A rendszertáblákon keresztüli lekérdezések – Azure Databricks olyan rendszertáblákat biztosít, amelyek rögzítik a feladatfuttatásokat és a feladatokat a fiókban. Ezeket a táblákat a feladatok teljesítményének és költségeinek lekérdezéséhez és elemzéséhez használhatja. Irányítópultokat hozhat létre a feladatok metrikáinak és trendjeinek megjelenítéséhez, amelyek segítenek a munkafolyamatok állapotának és teljesítményének monitorozásában.
Korlátozások
Az alábbi korlátozások érvényesek:
- Egy munkaterület legfeljebb 2000 egyidejű tevékenységfuttatásra korlátozódik.
429 Too Many Requestsválasz jelenik meg, ha olyan futtatást kér, amelyet a rendszer nem tud azonnal elindítani. - A munkaterület egy órán belül létrehozható feladatainak száma legfeljebb 10000 lehet (beleértve a "futtatások elküldését"). Ez a korlát a REST API- és jegyzetfüzet-munkafolyamatokkal létrehozott feladatokra is vonatkozik.
- Egy munkaterület legfeljebb 12000 mentett feladatot tartalmazhat.
- Egy feladat legfeljebb 1000 tevékenységet tartalmazhat.
- Ha a tevékenységek dinamikus értékeket használnak a paramétereikben, a feladatparaméterek legfeljebb 10 000 karakter hosszúságúak.
Munkafolyamatok programozott kezelése
A Databricks olyan eszközökkel és API-kkal rendelkezik, amelyekkel programozott módon ütemezheti és vezényelheti munkafolyamatait, beleértve a következőket:
- Databricks parancssori felület
- Deklaratív automatizációs csomagok
Databricks bővítmény Visual Studio Code - Databricks SDK-k
- Munkahelyek REST API
Példák a feladatok létrehozására és kezelésére szolgáló eszközök és API-k használatára: Feladatlétrehozás és -kezelés automatizálása. Az összes rendelkezésre álló developer tools dokumentációját Fejlesztői eszközök használati esetek című témakörben találja.
A külső eszközök a Databricks-eszközöket és API-kat használják a munkafolyamatok programozott ütemezéséhez. Feladatait ütemezheti olyan eszközökkel, mint a Azure Data Factory vagy az Apache AirFlow.
Munkafolyamat vezénylése az Apache Airflow-jal
Az Apache Airflow használatával kezelheti és ütemezheti az adat-munkafolyamatokat. Az Airflow használatával egy Python fájlban definiálhatja a munkafolyamatot, az Airflow pedig felügyeli a munkafolyamat ütemezését és futtatását. Lásd A Lakeflow-feladatok szervezése az Apache Airflow segítségével.
Workflow vezérlés Azure Data Factory
Azure Data Factory (ADF) egy felhőalapú adatintegrációs szolgáltatás, amellyel adattárolási, áthelyezési és feldolgozási szolgáltatásokat írhat automatizált adatfolyamokba. Az ADF használatával vezényelhet egy Azure Databricks feladatot egy ADF-folyamat részeként.
Az ADF beépített támogatással rendelkezik a Databricks-jegyzetfüzetek, Python szkriptek vagy az ADF-folyamatokban jar-okban csomagolt kód futtatásához.
A Databricks-jegyzetfüzetek ADF-folyamatban történő futtatásának módjáról lásd: Databricks-jegyzetfüzet futtatása a Databricks-jegyzetfüzet tevékenységgel az Azure Data Factoryben, továbbá Adatok átalakítása egy Databricks-jegyzetfüzet futtatásával.
Ha meg szeretné tanulni, hogyan futtathat Python szkriptet egy ADF-folyamatban, tekintse meg a az adatátalakítást Python-tevékenység futtatásával az Azure Databricksben.
A JAR-ban csomagolt kód ADF-folyamatban való futtatásáról a