Megjegyzés
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhat bejelentkezni vagy módosítani a címtárat.
Az oldalhoz való hozzáféréshez engedély szükséges. Megpróbálhatja módosítani a címtárat.
Ebben a fázisban megfigyelhetőségi és monitorozási stratégiákat tervez a működési kiválóság és a proaktív problémamegoldás érdekében.
Azure Databricks beépített megfigyelhetőségi képességeket biztosít a platformműveletek, a számítási feladatok teljesítménye, az adatok minősége és a modellkiszolgálók figyeléséhez. A megfigyelhetőségi stratégiát úgy tervezheti meg, hogy egyensúlyba hozza a működési megállapításokat a monitorozási költségekkel és az összetettséggel.
Rendszertáblák stratégiájának megtervezése
A rendszertáblák a fiók működési adatainak Azure Databricks üzemeltetett elemzési tárai. Előzménymegfigyelést biztosítanak a fiókban a használat, a teljesítmény, a költségek, a biztonság és a megfelelőség monitorozásához.
Rendszertáblák képességei
- Számlázás és használat: A költségek, a DBU-használat és a használati minták figyelése a munkaterületeken.
- Naplók: Munkaterületi tevékenységek, hozzáférési minták és megfelelőségi események nyomon követése.
- Lekérdezési előzmények: A lekérdezés teljesítményének, végrehajtási mintáinak és optimalizálási lehetőségeinek elemzése.
- Feladatfuttatások: A feladatok végrehajtási előzményeinek, sikerességi arányainak és hibamintáinak monitorozása.
- Adatleállás: Adatfüggőségek nyomon követése és a sémamódosítások hatásának megértése.
- Fürtcsoport események: A fürt létrehozásának, leállításának és erőforrás-kihasználtságának felügyelete.
A rendszertáblák használati esetei
- Költségoptimalizálás: A költséges lekérdezések, a kihasználatlan fürtök és a költségek csökkentésére szolgáló lehetőségek azonosítása.
- Biztonsági monitorozás: Hozzáférési minták naplózása, a rendellenességek azonosítása és a megfelelőség kényszerítése.
- Teljesítményelemzés: Lekérdezési minták elemzése, szűk keresztmetszetek azonosítása és számítási feladatok optimalizálása.
- Kapacitástervezés: Az erőforrás-igények előrejelzése a korábbi használati trendek alapján.
- Adatszabályozás: Az adatsorok nyomon követése, a hozzáférési minták monitorozása és a megfelelőség biztosítása.
Ajánlott eljárások a rendszertáblákhoz
- Az összes metaadattár rendszertábláinak engedélyezése átfogó használati adatok rögzítéséhez.
- Irányítópultok és riasztások létrehozása rendszertáblák alapján a proaktív figyeléshez.
- Rendszertáblák rendszeres lekérdezése az optimalizálási lehetőségek azonosításához.
- Rendszertáblák kombinálása audit naplókkal az átfogó szabályozási jelentéskészítéshez.
- Dokumentumkulcs-metrikák és küszöbértékek az operatív monitorozáshoz.
- Rendszertáblák használatával azonosíthatja a fel nem használt erőforrásokat, és csökkentheti a költségeket.
Példa monitorozási lekérdezések
- A 10 legdrágább lekérdezés fürtköltség szerint.
- Feladatokat nem sikerült végrehajtani munkaterület és felhasználó szerint.
- 24 óránál hosszabb ideig nem használt fürtök.
- Leggyakrabban használt táblák és kötetek.
- Adatsorok kritikus éles táblákhoz.
A rendszertáblák átfogó dokumentációját és a lekérdezési példákat a rendszertáblákra vonatkozó hivatkozásban találja.
Feladat- és folyamatfigyelési stratégia tervezése
Monitorozza a feladat- és folyamatvégrehajtást, hogy az adatfolyamok sikeresen fussanak, és gyorsan azonosíthassa a hibákat. A monitorozási stratégiát a számítási feladatok kritikussága, az SLA-k és az üzemeltetési követelmények alapján tervezheti meg.
Feladatmonitorozási minták
- Valós idejű riasztás: E-mail-értesítések vagy webhookok konfigurálása kritikus feladathibák esetén.
- Trendelemzés: A Munkafolyamatok és folyamatok monitorozása lapon nyomon követheti a feladatok futási előzményeit, és azonosíthatja a mintákat.
- Anomáliadetektálás: SQL-riasztások beállítása a feladatok időtartamának rendellenességeinek vagy ismétlődő hibáinak monitorozásához.
- SLA-monitorozás: SLA-k definiálása kritikus feladatokhoz, és riasztás, ha a feladatok túllépik a várt futtatókörnyezetet.
- Függőségek nyomon követése: Figyelheti a feladatfüggőségeket és a felsőbb rétegbeli hibákat, amelyek hatással vannak az alsóbb rétegbeli számítási feladatokra.
Folyamatfigyelési szempontok
- Lakeflow-adatfolyamok megfigyelhetősége: Kövesse nyomon a folyamatok futási állapotát, az adatminőségi elvárásokat és az adatleszármazást.
- Növekményes feldolgozás: Ellenőrzőpont-információk és növekményes feldolgozási metrikák nyomon követése.
- Adatfrissítés: Monitorozza a folyamat késését, és győződjön meg arról, hogy az adatok az SLA-ablakokon belül érkeznek.
- Hibakezelés: Újrapróbálkozási stratégiák és halottlevél-üzenetsorok tervezése sikertelen rekordok esetén.
Ajánlott eljárások a feladatok monitorozásához
- E-mail-értesítések vagy webhookok konfigurálása kritikus feladathibákhoz.
- Feladatok figyelése rendszertáblák segítségével (
system.workflow.job_runs,system.workflow.task_runs). - SQL-riasztások beállítása a feladatok időtartamának rendellenességeinek vagy ismétlődő hibáinak monitorozásához.
- Kritikus fontosságú feladatok SLA-jának meghatározása az üzleti követelmények alapján.
- Gyakori meghibásodási forgatókönyvek automatizálása runbook segítségével.
- Rendszeresen tekintse át a feladatok teljesítménybeli trendjeit, és optimalizálja a lassan futó feladatokat.
A feladatok monitorozásának részletes konfigurációját a Lakeflow-feladatok monitorozása című témakörben találja.
A Lakeflow-folyamatok megfigyelhetőségéért lásd a folyamatok monitorozását.
Spark-teljesítményfigyelési stratégia tervezése
A Spark-feladatok teljesítményének monitorozása az olyan szűk keresztmetszetek azonosításához, mint a ferdeség, a kiömlés, a hosszan futó feladatok, valamint a memória- vagy I/O-problémák. A Spark monitorozási megközelítését a számítási típus és a teljesítmény követelményei alapján tervezheti meg.
Lekérdezésprofil kiszolgáló nélküli és SQL-tárolókhoz
Kiszolgáló nélküli számítási és SQL-raktárak esetén a lekérdezési profillal elemezheti és optimalizálhatja a lekérdezési teljesítményt. A lekérdezésprofil részletes végrehajtási terveket, szakaszszintű metrikákat és optimalizálási javaslatokat tartalmaz.
Lekérdezésprofil képességei
- Lekérdezés-végrehajtási tervek vizualizációja szakaszszintű metrikákkal.
- Azonosíthatja a költséges műveleteket (például rendezéseket, illesztéseket, összesítéseket).
- Elemezheti az adateltéréseket és a partíciók egyensúlyhiányát.
- Tekintse át a lekérdezésoptimalizáló optimalizálási javaslatait.
- A lekérdezési teljesítmény összehasonlítása a futtatások között.
Ajánlott eljárások a lekérdezési profilhoz
- A lassú lekérdezések lekérdezésprofiljának áttekintése az optimalizálási lehetőségek azonosításához.
- Koncentráljon a magas végrehajtási idővel vagy adateltéréssel rendelkező szakaszokra.
- Valósítsa meg a javasolt optimalizálásokat, például a partíció metszést és a broadcast joinokat.
- Monitorozza a lekérdezési teljesítményt az optimalizálás után, hogy mérje a javulást.
Spark felhasználói felület a klasszikus számításhoz
Klasszikus számítási fürtök esetén a Spark felhasználói felületén azonosíthatja a teljesítménybeli szűk keresztmetszeteket és az erőforrás-korlátozásokat. A Spark felhasználói felülete részletes metrikákat biztosít a végrehajtókról, a szakaszokról, a feladatokról és a tárterületről.
Spark felhasználói felület képességei
- A fázis végrehajtási idejének és a tevékenységek elosztásának figyelése.
- Az adateltérés azonosítása a tevékenység időtartamának eltérésének elemzésével.
- A memóriahasználat és a kiömlési metrikák nyomon követése.
- Tekintse át a végrehajtói metrikákat (például PROCESSZOR, memória, lemez I/O).
- Olvasási/írási minták elemzése.
Ajánlott eljárások a Spark felhasználói felületéhez
- A klaszternaplók felhőtárolóba való továbbításának engedélyezése hosszú távú naplómegőrzés céljából.
- A fürtmetrikák (például CPU, memória, lemez I/O) monitorozása az erőforrás-korlátozások azonosításához.
- Tekintse át a Spark eseménynaplóit a lassú feladatok hibaelhárításához és a konfigurációk optimalizálásához.
- Koncentráljon a magas keveréssel vagy kiömléssel rendelkező szakaszokra a memóriaterhelés csökkentése érdekében.
- Optimalizálja a partícióméreteket a feladateltérés csökkentése érdekében.
A lekérdezésprofil dokumentációját a Lekérdezésprofil című témakörben találja.
A Spark felhasználói felület hibaelhárítási útmutatóját az Apache Spark áttekintésében találja.
Adatminőség-monitorozási stratégia tervezése
Az adatminőség-figyelés biztosítja, hogy a műveleti táblák megfeleljenek a minőségi szabványoknak, és azonosítja az adatok időbeli eltéréseit. Az adatminőség-monitorozási stratégiát a táblakritikusság, az adatfrissítési követelmények és a jogszabályi megfelelőség igényei alapján tervezheti meg.
Lakehouse felügyeleti képességek
- Idősoros monitorok: Az időalapú ablakok adatminőségi metrikáinak nyomon követése időbeli adatokat tartalmazó táblák esetén.
- Pillanatkép-figyelők: Az adatminőségi metrikák kiszámítása az összes adatra vonatkozóan egy adott időpontban.
- Statisztikai profilkészítés: Oszlopstatisztikák monitorozása (például min, max, mean, stddev, null szám).
- Adateltolódás észlelése: Az adateloszlások időbeli változásainak azonosítása.
- Anomáliadetektálás: Riasztás az adatminőségi metrikák váratlan változásairól.
Adatminőség-monitorozási minták
- Aranyréteg-monitorozás: Monitorok létrehozása az üzleti szempontból kritikus fontosságú aranyréteg-táblákhoz.
- Ezüstréteg ellenőrzése: Ezüstréteg-táblák figyelése a sémamegfelelőség és az adatminőség érdekében.
- Bronzréteg-ellenőrzések: Az adatbetöltés teljességének és formátummegfelelőségének ellenőrzése.
- Valós idejű riasztás: Riasztások beállítása az adatminőség megsértéseihez vagy rendellenességeihez.
- Adatfrissítés monitorozása: Monitorozza a folyamat késését, és győződjön meg arról, hogy az adatok az SLA-ablakokon belül érkeznek.
Ajánlott eljárások az adatminőség monitorozásához
- Kritikus fontosságú éles táblákhoz (különösen aranyréteg-táblákhoz) figyelőrendszereket hozzon létre.
- A minőségi trendek nyomon követéséhez idősoros monitorokat használjon az időalapú adatokat tartalmazó táblákhoz.
- Pillanatkép-monitorok használata idődimenziók nélküli táblákhoz.
- Riasztások beállítása az adatminőség megsértéseihez vagy rendellenességeihez.
- Monitorozza az adatok frissességét, hogy a folyamatok ütemezés szerint fussanak.
- Dokumentálja az adatminőségi küszöbértékeket és az eszkalációs eljárásokat.
A Lakehouse monitorozásának átfogó dokumentációját az Adatminőség-monitorozás című témakörben találja.
Tervezési modell monitorozási stratégiája
Monitorozza az üzembe helyezett ML-modelleket a teljesítmény, az állapot és a kérési metrikák nyomon követéséhez. A modellfigyelési stratégiát a modellkritikusság, az SLA követelményei és a megfelelőségi igények alapján tervezheti meg.
Megfigyelhetőségi képességeket kiszolgáló modell
- Végpont állapota: A végpont rendelkezésre állásának és állapotának figyelése.
- Meghívási metrikák: A kérések számának, késésének és átviteli sebességének nyomon követése.
- Következtetési táblázatok: Naplózza az előrejelzéseket és a modell viselkedésének időbeli elemzése.
- Modellverziókövetés: A modell verzióhasználatának és üzembe helyezési előzményeinek monitorozása.
- Hibafigyelés: Hibaarányok és hibaminták nyomon követése.
Modellfigyelési minták
- Valós idejű riasztás: Riasztások beállítása olyan anomáliákhoz, mint a nagy késés vagy a hibaarány.
- SLA-monitorozás: A gyártási modellekhez tartozó késési és rendelkezésre állási SLA-k meghatározása.
- Következtetéselemzés: Következtetési táblák használatával elemezheti az előrejelzési eloszlásokat, és észlelheti a sodródást.
- A/B-tesztelés: A modellverziók teljesítményének monitorozása a fejlesztések ellenőrzéséhez.
- Visszaállítási eljárások: Automatikus visszaállítási triggerek definiálása teljesítményküszöbök alapján.
Ajánlott eljárások a modell monitorozásához
- Monitorozza a végpont állapotát és a hívási metrikákat a teljesítményproblémák azonosításához.
- Nyomon követheti a késést és kérheti az átviteli sebességet az SLA-megfelelőség biztosítása érdekében.
- Következtetéstáblákkal naplózhatja az előrejelzéseket, és elemezheti a modell viselkedését.
- Riasztásokat állíthat be az olyan rendellenességek esetén, mint a nagy késés vagy a hibaarány.
- A modell verzióhasználatának monitorozása az üzemelő példányok és a visszaállítások nyomon követéséhez.
- Dokumentummodell teljesítménykonfigurációi és elfogadható küszöbértékei.
A modellmegjelenítési dokumentációt a modellminőség és a végpont állapotának figyelése című témakörben találja.
Külső monitorozási integrációs stratégia tervezése
Integrálhatja a Azure Databricks külső monitorozási megoldásokkal a központosított megfigyelhetőség érdekében a teljes infrastruktúrában. Az integrációs stratégiát a meglévő monitorozási eszközök, a működési követelmények és a csapat szakértelme alapján tervezheti meg.
Harmadik fél integrációs minták
- Centralizált monitorozás: Azure Databricks Metrika és naplók továbbítása központosított figyelési platformokra.
- Multi-cloud megfigyelhetőség: Felhőfüggetlen eszközökkel figyelheti az Azure Databricks-et több felhőn keresztül.
- Custom-irányítópultok: Egyesített irányítópultok létrehozása Azure Databricks és külső rendszermetrikák kombinálásával.
- Alerting integráció: Azure Databricks riasztások átirányítása meglévő incidenskezelő rendszereken keresztül.
- Megfelelőségi jelentés: A megfelelőségi és naplózási követelmények naplóinak összesítése.
Integrációs lehetőségek
- Datadog: Fürtmetrikák, feladatfuttatások és alkalmazásnaplók monitorozása Datadog-integrációval.
- Prometheus: A fürtmetrikák exportálása a Prometheusba idősoros monitorozás és riasztások céljából.
- Azure Monitor: Továbbítsa a naplókat az Azure Log Analyticshez az Azure Databricks telepítésekhez.
- Azure Sentinel: Az auditnaplók integrálása Azure Sentinellel a biztonsági monitorozáshoz.
Ajánlott eljárások külső integrációkhoz
- Használjon standard integrációkat (például Datadog, Prometheus), ahol elérhető.
- Naplók továbbítása központosított naplózási platformokra a hosszú távú megőrzés érdekében.
- Korrelálja Azure Databricks metrikákat az infrastruktúra-metrikákkal a kiváltó okok elemzéséhez.
- Konzisztens címkézés implementálása Azure Databricks és külső rendszereken.
- Rendszeresen tesztelje a riasztások útválasztási és eszkalációs eljárásait.
Megfigyelhetőségi javaslatok
Ajánlott
- Az összes metaadattár rendszertábláinak engedélyezése átfogó használati adatok rögzítéséhez.
- Irányítópultok létrehozása rendszertáblák alapján a költségek, a teljesítmény és a biztonsági monitorozás érdekében.
- A feladat- és folyamatfigyelés konfigurálása kritikus hibákra vonatkozó riasztásokkal.
- Engedélyezze a Spark monitorozását (lekérdezésprofil, Spark felhasználói felület) a teljesítmény hibaelhárításához.
- Lakehouse-monitorozás létrehozása kritikus termelési táblákhoz (aranyréteg).
- Monitorozza a végpontokat kiszolgáló modellt a késés, az átviteli sebesség és a hibaarányok szempontjából.
- Integrálható külső monitorozási megoldásokkal a központosított megfigyelhetőség érdekében.
- SLA-k és riasztási küszöbértékek definiálása kritikus számítási feladatokhoz.
- Gyakori üzemeltetési forgatókönyvek műveleti útmutatói.
Értékelés követelmények alapján
- Kiegyensúlyozza a monitorozás részletességét a működési terheléssel és költségekkel.
- Csak akkor vegye figyelembe a külső integrációkat, ha központosított monitorozásra van szükség.
- Értékelje ki a valós idejű riasztást és a kötegfigyelést az SLA-követelmények alapján.
- Fontolja meg az adatminőség monitorozási költségeit (például tárolás, számítás) a nagy táblák esetében.
- A riasztások kimerültségének tesztelése a konzervatív küszöbértékekkel kezdve és az idő múlásával történő finomítással.
9. fázis eredményei
A 9. fázis befejezése után a következővel kell rendelkeznie:
- Kulcsmonitorozási lekérdezésekkel és irányítópultokkal definiált rendszertáblák stratégiája.
- A feladat- és folyamatfigyelés kritikus hibákra vonatkozó riasztásokkal van konfigurálva.
- A Spark teljesítménymonitorozási megközelítése (lekérdezésprofil, Spark felhasználói felület).
- Kritikus táblákhoz a Lakehouse Monitoring eszközzel meghatározott adatminőség-ellenőrzési stratégiát alkalmazunk.
- Modellfigyelési stratégia ml-végpontokhoz.
- Harmadik féltől származó monitorozási integrációs megközelítés definiálva (ha van).
- A kritikus számítási feladatokhoz dokumentált SLA-k és riasztási küszöbértékek.
- A gyakori monitorozási forgatókönyvekhez létrehozott operatív runbookok.
Következő fázis: 10. fázis: Magas rendelkezésre állás és vészhelyreállítás tervezése
Megvalósítási útmutató: A megfigyelhetőségi stratégia megvalósítására vonatkozó részletes útmutatásért tekintse meg a rendszertáblákra vonatkozó referencia és a Lakeflow-feladatok monitorozása című témakört.