9. fázis: Megfigyelhetőségi stratégia tervezése

Ebben a fázisban megfigyelhetőségi és monitorozási stratégiákat tervez a működési kiválóság és a proaktív problémamegoldás érdekében.

Azure Databricks beépített megfigyelhetőségi képességeket biztosít a platformműveletek, a számítási feladatok teljesítménye, az adatok minősége és a modellkiszolgálók figyeléséhez. A megfigyelhetőségi stratégiát úgy tervezheti meg, hogy egyensúlyba hozza a működési megállapításokat a monitorozási költségekkel és az összetettséggel.

Rendszertáblák stratégiájának megtervezése

A rendszertáblák a fiók működési adatainak Azure Databricks üzemeltetett elemzési tárai. Előzménymegfigyelést biztosítanak a fiókban a használat, a teljesítmény, a költségek, a biztonság és a megfelelőség monitorozásához.

Rendszertáblák képességei

  • Számlázás és használat: A költségek, a DBU-használat és a használati minták figyelése a munkaterületeken.
  • Naplók: Munkaterületi tevékenységek, hozzáférési minták és megfelelőségi események nyomon követése.
  • Lekérdezési előzmények: A lekérdezés teljesítményének, végrehajtási mintáinak és optimalizálási lehetőségeinek elemzése.
  • Feladatfuttatások: A feladatok végrehajtási előzményeinek, sikerességi arányainak és hibamintáinak monitorozása.
  • Adatleállás: Adatfüggőségek nyomon követése és a sémamódosítások hatásának megértése.
  • Fürtcsoport események: A fürt létrehozásának, leállításának és erőforrás-kihasználtságának felügyelete.

A rendszertáblák használati esetei

  • Költségoptimalizálás: A költséges lekérdezések, a kihasználatlan fürtök és a költségek csökkentésére szolgáló lehetőségek azonosítása.
  • Biztonsági monitorozás: Hozzáférési minták naplózása, a rendellenességek azonosítása és a megfelelőség kényszerítése.
  • Teljesítményelemzés: Lekérdezési minták elemzése, szűk keresztmetszetek azonosítása és számítási feladatok optimalizálása.
  • Kapacitástervezés: Az erőforrás-igények előrejelzése a korábbi használati trendek alapján.
  • Adatszabályozás: Az adatsorok nyomon követése, a hozzáférési minták monitorozása és a megfelelőség biztosítása.

Ajánlott eljárások a rendszertáblákhoz

  • Az összes metaadattár rendszertábláinak engedélyezése átfogó használati adatok rögzítéséhez.
  • Irányítópultok és riasztások létrehozása rendszertáblák alapján a proaktív figyeléshez.
  • Rendszertáblák rendszeres lekérdezése az optimalizálási lehetőségek azonosításához.
  • Rendszertáblák kombinálása audit naplókkal az átfogó szabályozási jelentéskészítéshez.
  • Dokumentumkulcs-metrikák és küszöbértékek az operatív monitorozáshoz.
  • Rendszertáblák használatával azonosíthatja a fel nem használt erőforrásokat, és csökkentheti a költségeket.

Példa monitorozási lekérdezések

  • A 10 legdrágább lekérdezés fürtköltség szerint.
  • Feladatokat nem sikerült végrehajtani munkaterület és felhasználó szerint.
  • 24 óránál hosszabb ideig nem használt fürtök.
  • Leggyakrabban használt táblák és kötetek.
  • Adatsorok kritikus éles táblákhoz.

A rendszertáblák átfogó dokumentációját és a lekérdezési példákat a rendszertáblákra vonatkozó hivatkozásban találja.

Feladat- és folyamatfigyelési stratégia tervezése

Monitorozza a feladat- és folyamatvégrehajtást, hogy az adatfolyamok sikeresen fussanak, és gyorsan azonosíthassa a hibákat. A monitorozási stratégiát a számítási feladatok kritikussága, az SLA-k és az üzemeltetési követelmények alapján tervezheti meg.

Feladatmonitorozási minták

  • Valós idejű riasztás: E-mail-értesítések vagy webhookok konfigurálása kritikus feladathibák esetén.
  • Trendelemzés: A Munkafolyamatok és folyamatok monitorozása lapon nyomon követheti a feladatok futási előzményeit, és azonosíthatja a mintákat.
  • Anomáliadetektálás: SQL-riasztások beállítása a feladatok időtartamának rendellenességeinek vagy ismétlődő hibáinak monitorozásához.
  • SLA-monitorozás: SLA-k definiálása kritikus feladatokhoz, és riasztás, ha a feladatok túllépik a várt futtatókörnyezetet.
  • Függőségek nyomon követése: Figyelheti a feladatfüggőségeket és a felsőbb rétegbeli hibákat, amelyek hatással vannak az alsóbb rétegbeli számítási feladatokra.

Folyamatfigyelési szempontok

  • Lakeflow-adatfolyamok megfigyelhetősége: Kövesse nyomon a folyamatok futási állapotát, az adatminőségi elvárásokat és az adatleszármazást.
  • Növekményes feldolgozás: Ellenőrzőpont-információk és növekményes feldolgozási metrikák nyomon követése.
  • Adatfrissítés: Monitorozza a folyamat késését, és győződjön meg arról, hogy az adatok az SLA-ablakokon belül érkeznek.
  • Hibakezelés: Újrapróbálkozási stratégiák és halottlevél-üzenetsorok tervezése sikertelen rekordok esetén.

Ajánlott eljárások a feladatok monitorozásához

  • E-mail-értesítések vagy webhookok konfigurálása kritikus feladathibákhoz.
  • Feladatok figyelése rendszertáblák segítségével (system.workflow.job_runs, system.workflow.task_runs).
  • SQL-riasztások beállítása a feladatok időtartamának rendellenességeinek vagy ismétlődő hibáinak monitorozásához.
  • Kritikus fontosságú feladatok SLA-jának meghatározása az üzleti követelmények alapján.
  • Gyakori meghibásodási forgatókönyvek automatizálása runbook segítségével.
  • Rendszeresen tekintse át a feladatok teljesítménybeli trendjeit, és optimalizálja a lassan futó feladatokat.

A feladatok monitorozásának részletes konfigurációját a Lakeflow-feladatok monitorozása című témakörben találja.

A Lakeflow-folyamatok megfigyelhetőségéért lásd a folyamatok monitorozását.

Spark-teljesítményfigyelési stratégia tervezése

A Spark-feladatok teljesítményének monitorozása az olyan szűk keresztmetszetek azonosításához, mint a ferdeség, a kiömlés, a hosszan futó feladatok, valamint a memória- vagy I/O-problémák. A Spark monitorozási megközelítését a számítási típus és a teljesítmény követelményei alapján tervezheti meg.

Lekérdezésprofil kiszolgáló nélküli és SQL-tárolókhoz

Kiszolgáló nélküli számítási és SQL-raktárak esetén a lekérdezési profillal elemezheti és optimalizálhatja a lekérdezési teljesítményt. A lekérdezésprofil részletes végrehajtási terveket, szakaszszintű metrikákat és optimalizálási javaslatokat tartalmaz.

Lekérdezésprofil képességei

  • Lekérdezés-végrehajtási tervek vizualizációja szakaszszintű metrikákkal.
  • Azonosíthatja a költséges műveleteket (például rendezéseket, illesztéseket, összesítéseket).
  • Elemezheti az adateltéréseket és a partíciók egyensúlyhiányát.
  • Tekintse át a lekérdezésoptimalizáló optimalizálási javaslatait.
  • A lekérdezési teljesítmény összehasonlítása a futtatások között.

Ajánlott eljárások a lekérdezési profilhoz

  • A lassú lekérdezések lekérdezésprofiljának áttekintése az optimalizálási lehetőségek azonosításához.
  • Koncentráljon a magas végrehajtási idővel vagy adateltéréssel rendelkező szakaszokra.
  • Valósítsa meg a javasolt optimalizálásokat, például a partíció metszést és a broadcast joinokat.
  • Monitorozza a lekérdezési teljesítményt az optimalizálás után, hogy mérje a javulást.

Spark felhasználói felület a klasszikus számításhoz

Klasszikus számítási fürtök esetén a Spark felhasználói felületén azonosíthatja a teljesítménybeli szűk keresztmetszeteket és az erőforrás-korlátozásokat. A Spark felhasználói felülete részletes metrikákat biztosít a végrehajtókról, a szakaszokról, a feladatokról és a tárterületről.

Spark felhasználói felület képességei

  • A fázis végrehajtási idejének és a tevékenységek elosztásának figyelése.
  • Az adateltérés azonosítása a tevékenység időtartamának eltérésének elemzésével.
  • A memóriahasználat és a kiömlési metrikák nyomon követése.
  • Tekintse át a végrehajtói metrikákat (például PROCESSZOR, memória, lemez I/O).
  • Olvasási/írási minták elemzése.

Ajánlott eljárások a Spark felhasználói felületéhez

  • A klaszternaplók felhőtárolóba való továbbításának engedélyezése hosszú távú naplómegőrzés céljából.
  • A fürtmetrikák (például CPU, memória, lemez I/O) monitorozása az erőforrás-korlátozások azonosításához.
  • Tekintse át a Spark eseménynaplóit a lassú feladatok hibaelhárításához és a konfigurációk optimalizálásához.
  • Koncentráljon a magas keveréssel vagy kiömléssel rendelkező szakaszokra a memóriaterhelés csökkentése érdekében.
  • Optimalizálja a partícióméreteket a feladateltérés csökkentése érdekében.

A lekérdezésprofil dokumentációját a Lekérdezésprofil című témakörben találja.

A Spark felhasználói felület hibaelhárítási útmutatóját az Apache Spark áttekintésében találja.

Adatminőség-monitorozási stratégia tervezése

Az adatminőség-figyelés biztosítja, hogy a műveleti táblák megfeleljenek a minőségi szabványoknak, és azonosítja az adatok időbeli eltéréseit. Az adatminőség-monitorozási stratégiát a táblakritikusság, az adatfrissítési követelmények és a jogszabályi megfelelőség igényei alapján tervezheti meg.

Lakehouse felügyeleti képességek

  • Idősoros monitorok: Az időalapú ablakok adatminőségi metrikáinak nyomon követése időbeli adatokat tartalmazó táblák esetén.
  • Pillanatkép-figyelők: Az adatminőségi metrikák kiszámítása az összes adatra vonatkozóan egy adott időpontban.
  • Statisztikai profilkészítés: Oszlopstatisztikák monitorozása (például min, max, mean, stddev, null szám).
  • Adateltolódás észlelése: Az adateloszlások időbeli változásainak azonosítása.
  • Anomáliadetektálás: Riasztás az adatminőségi metrikák váratlan változásairól.

Adatminőség-monitorozási minták

  • Aranyréteg-monitorozás: Monitorok létrehozása az üzleti szempontból kritikus fontosságú aranyréteg-táblákhoz.
  • Ezüstréteg ellenőrzése: Ezüstréteg-táblák figyelése a sémamegfelelőség és az adatminőség érdekében.
  • Bronzréteg-ellenőrzések: Az adatbetöltés teljességének és formátummegfelelőségének ellenőrzése.
  • Valós idejű riasztás: Riasztások beállítása az adatminőség megsértéseihez vagy rendellenességeihez.
  • Adatfrissítés monitorozása: Monitorozza a folyamat késését, és győződjön meg arról, hogy az adatok az SLA-ablakokon belül érkeznek.

Ajánlott eljárások az adatminőség monitorozásához

  • Kritikus fontosságú éles táblákhoz (különösen aranyréteg-táblákhoz) figyelőrendszereket hozzon létre.
  • A minőségi trendek nyomon követéséhez idősoros monitorokat használjon az időalapú adatokat tartalmazó táblákhoz.
  • Pillanatkép-monitorok használata idődimenziók nélküli táblákhoz.
  • Riasztások beállítása az adatminőség megsértéseihez vagy rendellenességeihez.
  • Monitorozza az adatok frissességét, hogy a folyamatok ütemezés szerint fussanak.
  • Dokumentálja az adatminőségi küszöbértékeket és az eszkalációs eljárásokat.

A Lakehouse monitorozásának átfogó dokumentációját az Adatminőség-monitorozás című témakörben találja.

Tervezési modell monitorozási stratégiája

Monitorozza az üzembe helyezett ML-modelleket a teljesítmény, az állapot és a kérési metrikák nyomon követéséhez. A modellfigyelési stratégiát a modellkritikusság, az SLA követelményei és a megfelelőségi igények alapján tervezheti meg.

Megfigyelhetőségi képességeket kiszolgáló modell

  • Végpont állapota: A végpont rendelkezésre állásának és állapotának figyelése.
  • Meghívási metrikák: A kérések számának, késésének és átviteli sebességének nyomon követése.
  • Következtetési táblázatok: Naplózza az előrejelzéseket és a modell viselkedésének időbeli elemzése.
  • Modellverziókövetés: A modell verzióhasználatának és üzembe helyezési előzményeinek monitorozása.
  • Hibafigyelés: Hibaarányok és hibaminták nyomon követése.

Modellfigyelési minták

  • Valós idejű riasztás: Riasztások beállítása olyan anomáliákhoz, mint a nagy késés vagy a hibaarány.
  • SLA-monitorozás: A gyártási modellekhez tartozó késési és rendelkezésre állási SLA-k meghatározása.
  • Következtetéselemzés: Következtetési táblák használatával elemezheti az előrejelzési eloszlásokat, és észlelheti a sodródást.
  • A/B-tesztelés: A modellverziók teljesítményének monitorozása a fejlesztések ellenőrzéséhez.
  • Visszaállítási eljárások: Automatikus visszaállítási triggerek definiálása teljesítményküszöbök alapján.

Ajánlott eljárások a modell monitorozásához

  • Monitorozza a végpont állapotát és a hívási metrikákat a teljesítményproblémák azonosításához.
  • Nyomon követheti a késést és kérheti az átviteli sebességet az SLA-megfelelőség biztosítása érdekében.
  • Következtetéstáblákkal naplózhatja az előrejelzéseket, és elemezheti a modell viselkedését.
  • Riasztásokat állíthat be az olyan rendellenességek esetén, mint a nagy késés vagy a hibaarány.
  • A modell verzióhasználatának monitorozása az üzemelő példányok és a visszaállítások nyomon követéséhez.
  • Dokumentummodell teljesítménykonfigurációi és elfogadható küszöbértékei.

A modellmegjelenítési dokumentációt a modellminőség és a végpont állapotának figyelése című témakörben találja.

Külső monitorozási integrációs stratégia tervezése

Integrálhatja a Azure Databricks külső monitorozási megoldásokkal a központosított megfigyelhetőség érdekében a teljes infrastruktúrában. Az integrációs stratégiát a meglévő monitorozási eszközök, a működési követelmények és a csapat szakértelme alapján tervezheti meg.

Harmadik fél integrációs minták

  • Centralizált monitorozás: Azure Databricks Metrika és naplók továbbítása központosított figyelési platformokra.
  • Multi-cloud megfigyelhetőség: Felhőfüggetlen eszközökkel figyelheti az Azure Databricks-et több felhőn keresztül.
  • Custom-irányítópultok: Egyesített irányítópultok létrehozása Azure Databricks és külső rendszermetrikák kombinálásával.
  • Alerting integráció: Azure Databricks riasztások átirányítása meglévő incidenskezelő rendszereken keresztül.
  • Megfelelőségi jelentés: A megfelelőségi és naplózási követelmények naplóinak összesítése.

Integrációs lehetőségek

  • Datadog: Fürtmetrikák, feladatfuttatások és alkalmazásnaplók monitorozása Datadog-integrációval.
  • Prometheus: A fürtmetrikák exportálása a Prometheusba idősoros monitorozás és riasztások céljából.
  • Azure Monitor: Továbbítsa a naplókat az Azure Log Analyticshez az Azure Databricks telepítésekhez.
  • Azure Sentinel: Az auditnaplók integrálása Azure Sentinellel a biztonsági monitorozáshoz.

Ajánlott eljárások külső integrációkhoz

  • Használjon standard integrációkat (például Datadog, Prometheus), ahol elérhető.
  • Naplók továbbítása központosított naplózási platformokra a hosszú távú megőrzés érdekében.
  • Korrelálja Azure Databricks metrikákat az infrastruktúra-metrikákkal a kiváltó okok elemzéséhez.
  • Konzisztens címkézés implementálása Azure Databricks és külső rendszereken.
  • Rendszeresen tesztelje a riasztások útválasztási és eszkalációs eljárásait.

Megfigyelhetőségi javaslatok

Ajánlott

  • Az összes metaadattár rendszertábláinak engedélyezése átfogó használati adatok rögzítéséhez.
  • Irányítópultok létrehozása rendszertáblák alapján a költségek, a teljesítmény és a biztonsági monitorozás érdekében.
  • A feladat- és folyamatfigyelés konfigurálása kritikus hibákra vonatkozó riasztásokkal.
  • Engedélyezze a Spark monitorozását (lekérdezésprofil, Spark felhasználói felület) a teljesítmény hibaelhárításához.
  • Lakehouse-monitorozás létrehozása kritikus termelési táblákhoz (aranyréteg).
  • Monitorozza a végpontokat kiszolgáló modellt a késés, az átviteli sebesség és a hibaarányok szempontjából.
  • Integrálható külső monitorozási megoldásokkal a központosított megfigyelhetőség érdekében.
  • SLA-k és riasztási küszöbértékek definiálása kritikus számítási feladatokhoz.
  • Gyakori üzemeltetési forgatókönyvek műveleti útmutatói.

Értékelés követelmények alapján

  • Kiegyensúlyozza a monitorozás részletességét a működési terheléssel és költségekkel.
  • Csak akkor vegye figyelembe a külső integrációkat, ha központosított monitorozásra van szükség.
  • Értékelje ki a valós idejű riasztást és a kötegfigyelést az SLA-követelmények alapján.
  • Fontolja meg az adatminőség monitorozási költségeit (például tárolás, számítás) a nagy táblák esetében.
  • A riasztások kimerültségének tesztelése a konzervatív küszöbértékekkel kezdve és az idő múlásával történő finomítással.

9. fázis eredményei

A 9. fázis befejezése után a következővel kell rendelkeznie:

  • Kulcsmonitorozási lekérdezésekkel és irányítópultokkal definiált rendszertáblák stratégiája.
  • A feladat- és folyamatfigyelés kritikus hibákra vonatkozó riasztásokkal van konfigurálva.
  • A Spark teljesítménymonitorozási megközelítése (lekérdezésprofil, Spark felhasználói felület).
  • Kritikus táblákhoz a Lakehouse Monitoring eszközzel meghatározott adatminőség-ellenőrzési stratégiát alkalmazunk.
  • Modellfigyelési stratégia ml-végpontokhoz.
  • Harmadik féltől származó monitorozási integrációs megközelítés definiálva (ha van).
  • A kritikus számítási feladatokhoz dokumentált SLA-k és riasztási küszöbértékek.
  • A gyakori monitorozási forgatókönyvekhez létrehozott operatív runbookok.

Következő fázis: 10. fázis: Magas rendelkezésre állás és vészhelyreállítás tervezése

Megvalósítási útmutató: A megfigyelhetőségi stratégia megvalósítására vonatkozó részletes útmutatásért tekintse meg a rendszertáblákra vonatkozó referencia és a Lakeflow-feladatok monitorozása című témakört.