Poznámka:
Přístup k této stránce vyžaduje autorizaci. Můžete se zkusit přihlásit nebo změnit adresáře.
Přístup k této stránce vyžaduje autorizaci. Můžete zkusit změnit adresáře.
Platí pro toto doporučení z kontrolního seznamu Azure Well-Architected Framework: Operational Excellence:
| OE:07 | Navrhněte monitorovací sadu, která zachycuje provozní telemetrii, metriky a logy z infrastruktury a kódu úlohy, aby sloužila k ověření rozhodnutí o návrhu a k usměrňování budoucích vylepšení. |
|---|
Pozorovatelnost nebo monitorování je klíčovým provozním postupem, který týmu úloh umožňuje porozumět internímu stavu systému na základě externích dat, která vytváří. Na rozdíl od funkčního zásobníku, který implementuje obchodní logiku a základní funkce, běží zásobník monitorování paralelně. Shromažďuje a analyzuje metriky, protokoly, trasování a události, které ukazují, jak se úlohy chovají za reálných podmínek.
Návrh monitorovacího stacku vyžaduje pečlivé plánování, protože zajišťuje přehled o průřezových oblastech, jako jsou spolehlivost, výkon, zabezpečení a náklady. Dobře navržená sada monitorování umožňuje včasné zjišťování problémů, efektivní reakci na incidenty a informovaná provozní rozhodnutí. Tvoří základ pro proaktivní správu a průběžné zlepšování.
Tato příručka popisuje klíčové strategie návrhu monitorovacího stacku, který podporuje funkce monitorování, detekce a alarmování. Pokyny pro implementaci, včetně postupných procesů a příruček, najdete v doprovodném článku: Vytvořte monitorovací systém pro úlohy Azure.
Definice
| Pojem | definice |
|---|---|
| Telemetrie | Souhrnný termín pro protokoly, metriky, trasování a události. Telemetrie poskytuje základ pro pozorovatelnost. |
| Protokoly | Zaznamenané systémové události, které zachycují, co se stalo v systému. Protokoly můžou být strukturované nebo volné texty s časovými razítky. Jsou užitečné pro detekci a zkoumání anomálií. |
| Metrics | Číselné hodnoty shromážděné v pravidelných intervalech, které popisují výkon systému. Metriky pomáhají identifikovat trendy v výkonu a spolehlivosti úloh. |
| Pozorovatelnost | Postup, který pomáhá týmům zjišťovat problémy, sledovat trendy výkonu a provádět provozní rozhodnutí. |
| ID korelací | Jedinečné identifikátory, které sledují související události napříč více komponentami a umožňují kompletní trasování transakcí v distribuovaných systémech. |
| instrumentace | Přidání možností monitorování do aplikací a infrastruktury pro zachytávání telemetrie Zachycená telemetrie zahrnuje protokolování, shromažďování metrik a trasování. |
| Model zdraví | Architektura pro měření stavu úloh pomocí ukazatelů, klíčových ukazatelů výkonu a metrik, které odrážejí obchodní a provozní cíle. |
| Klíčové ukazatele výkonu (KPI) | Měřitelné hodnoty, které ukazují, jak efektivně úloha dosahuje obchodních a provozních cílů. Klíčové ukazatele výkonu řídí shromažďování a analýzu telemetrie. |
| Správa výkonu aplikací (APM) | Nástroje a postupy pro monitorování výkonu, dostupnosti a uživatelského prostředí aplikací Nástroje APM poskytují přehled o důležitých metrikách v reálném čase a historii. |
| Traces | Záznamy, které zobrazují cesty požadavků prostřednictvím distribuovaných systémů. Trasování pomáhá při diagnostice problémů napříč více službami. |
Sladění telemetrie s modely stavu a klíčových ukazatelů výkonu
Definujte ukazatele stavu úloh, klíčové ukazatele výkonu a metriky výkonu, aby strategie shromažďování telemetrie odrážely tyto cíle. Sledujte tyto indikátory a detekujte anomálie, abyste mohli rozhodovat o nápravných akcích.
Svázejte telemetrii se systémem a toky uživatelů a modelujte je jako entity v modelu stavu. Tento přístup spojuje stav na úrovni aplikace se signály na úrovni prostředků a celkovým stavem úloh, takže snížení úrovně závislostí se zobrazí na úrovni, kde je viditelný obchodní dopad.
Příležitost umělé inteligence: Teams tráví čas ručním definováním klíčových ukazatelů výkonu a telemetrie. Nástroje s asistencí umělé inteligence můžou navrhovat běžně používaná telemetrická data na základě architektury, závislostí služeb a kódu. Nástroje, jako jsou GitHub Copilot nebo Claude Code, můžou také pomoct přidat instrumentaci a generovat dotazy nebo šablony infrastruktury jako kódu (IaC). Zahrňte lidský dohled, abyste zajistili, že pozorovatelnost řízená AI zůstane přesná a v souladu se standardy.
Generování telemetrie z komponent úloh
Zachytávání smysluplných signálů z aplikací, infrastruktury a provozu Protokolovat kritické výjimky s dostatečnými podrobnostmi, ale umožnit upravení úrovně verbóznosti pro kontrolu šumu.
Preferujte strukturovanou telemetrii, aby data byla dotazovatelná a prohledávatelná. Používejte konzistentní schémata a zahrňte kontextové informace, jako jsou zdrojová komponenta, časová razítka atd. Snažte se o konzistenci, protože umožňuje přesnější analýzu událostí a jasnější korelaci s požadavky uživatelů. Abyste toho dosáhli, přijměte konfigurovatelnou architekturu protokolování, která standardizuje způsob zachycení informací v celém systému.
Kompromis: Zvyšte podrobnosti protokolování, abyste zlepšili ladicí možnosti a sledovatelnost, ale mějte na paměti, že jsou vyšší náklady na úložiště a zpracování. Pro správu tohoto kompromisu použijte podrobné protokolování ve vývoji a omezte úroveň podrobností v produkčním prostředí a spoléhejte se na korelační ID, abyste zachovali viditelnost komplexních transakcí bez nadměrného objemu protokolů.
Potřebujete způsob, jak klasifikovat telemetrii podle provozních obav, jako je audit, zabezpečení, ladění a výkon, a zjednodušit filtrování a vynucování správných řízení přístupu. Ujistěte se, že data úloh nejsou smíšená s telemetrií. Před protokolováním vyčistit citlivé systémové nebo uživatelské informace a přitom zachovat dostatečný kontext pro diagnostiku.
Ujistěte se, že postupy instrumentace jsou z hlediska provozuschopné. Protokolování by mělo být aktivované a zapomenuté, takže neblokuje obchodní operace s výjimkou kritických scénářů auditování. Udržujte instrumentaci rozšiřitelnou a oddělenou od konkrétních back-endů a zajistěte, aby selhání v telemetrii nedošlo k kaskádovým selháním aplikace.
Pohlížejte na instrumentaci jako na iterativní disciplínu. Pravidelně kontrolujte a upřesněte telemetrii, abyste zachovali přehlednost, relevanci a výkon při vývoji systému.
Poznámka:
Profilace aplikací může být dalším způsobem analýzy způsobu, jakým spuštěná aplikace používá systémové prostředky, jako jsou procesor, paměť, vstupně-výstupní operace disku a síť. Profiler se připojí k vaší aplikaci (během vývoje nebo v produkčním prostředí) a shromažďuje podrobná data modulu runtime. Existují dva přístupy: úplná profilace nebo ukázková. Úplný profil je přesnější, ale může výrazně zatěžovat a zpomalovat systém. Můžete zvolit vzorkování, kde se data shromažďují na základě času, například jednou za n sekund nebo četnosti, například jednou za každých n požadavků. Pokud jsou události časté, použijte vzorkování, abyste snížili režii. Pokud jsou události vzácné, používejte podrobnější profilování, abyste je nezmeškali.
Shromažďování telemetrie napříč úlohou
Systémy telemetrie používají dva základní modely shromažďování. V pull modelu komponenta shromažďuje telemetrii dotazováním cílového systému. V push modelu komponenty odesílají telemetrii při odesílání dat ven. Vyberte model na základě faktorů, které se vztahují na vaši úlohu. Jsou například pravidelné snímky dostatečné nebo potřebujete data téměř v reálném čase? Jaký je očekávaný objem telemetrických dat? Jaký je typ dat: stavová data, nebo protokoly, události a trasovací data?
Běžně se používá kombinovaný přístup. Agenti monitorování můžou například používat model vyžádání obsahu, který běží místně společně s každou instancí aplikace, aby pravidelně shromažďovali data a zapisovali je do sdíleného úložiště. Současně můžete pro telemetrii aplikace použít model push, kdy každá instance odesílá protokoly, trasování a metriky do fronty zpráv nebo proudu událostí při vzniku událostí.
Určete prioritu přenosu dat na základě důležitosti. Méně urgentní data je možné přenášet v dávkách, ale informace citlivé na čas by se měly odesílat okamžitě.
Standardizace konsolidace dat
Přesuňte telemetrii z místních sil a zkonsolidujte ji do centrálního úložiště, pokud je to organizačně vyžadováno. V případě řešení s více oblastmi nejprve shromážděte a ukládejte data regionálně a pak je centrálně agregujte. Pro důležité obchodní úlohy ale doporučujeme autonomní úložiště dat.
Používejte konzistentní formáty a metody shromažďování, aby k datům bylo možné přistupovat pro analýzy, řídicí panely, upozorňování a vytváření sestav. Vyhněte se ručnímu získávání z komponent, protože zvyšuje režii a vede k nekonzistencím.
Použití služeb konsolidace dat k:
- Odstranění duplicitních dat
- Sloučení souvisejících událostí pomocí ID korelace
- Vyfiltrujte nepotřebné informace.
Riziko: Mějte na paměti, že pro regionální a centralizované úložiště dat existují nákladové důsledky.
Přizpůsobení úložiště a uchovávání pro vzory využití
Výběr řešení úložiště primárně na základě potřeb dotazů a vzorů přístupu Například data, která generují výstrahy, musí být rychle přístupná, takže by se měla uchovávat v rychlém úložišti dat a indexovaná nebo strukturovaná za účelem optimalizace dotazů.
Polyglotní trvalost slouží k ukládání různých datových typů v technologiích, které jsou vhodné pro jejich použití:
- Databáze SQL pro čítače výkonu
- protokoly Azure Monitor nebo Azure Data Explorer pro protokoly trasování
- Hadoop Distributed File System (HDFS) pro informace o zabezpečení
Oddělení úložiště dat také podle prostředí. Toto oddělení zabraňuje nekritickým datům prostředí v komplikování produkčního monitorování.
Plánování uchovávání dat na základě toho, jak budete data používat. Udržujte data s vysokým rozlišením pro krátkodobou analýzu a ladění a zachovejte agregace s nižším rozlišením pro dlouhodobé trendy. Přesuňte starší nebo zřídka přístupná data do levnějšího úložiště a zachovejte nedávná data v rychlejších systémech pro rychlou analýzu. Tím se vyrovnává výkon s náklady. Nastavte dobu uchovávání tak, aby odpovídala provozním potřebám a požadavkům na dodržování předpisů, aby data byla dostupná v případě potřeby bez zbytečné režie na úložiště.
Zacházejte s daty monitorování jako s jinými důležitými daty. Použijte odpovídající ochranu – řízení přístupu, obnovitelné odstranění a ochrana proti náhodným změnám.
Korelace dat pro ucelené přehledy
Navrhněte pozorovatelnost pro připojení telemetrie z metrik, logů a trasování napříč všemi komponentami. Tento návrh umožňuje distribuované trasování operací napříč službami, což pomáhá diagnostikovat problémy, které pokrývají více vrstev.
Id korelace můžete konzistentně používat ke sledování transakcí prostřednictvím prezentačních, prostředních a datových vrstev.
Agregace protokolů na úrovni aplikace a prostředků za účelem zlepšení řešení potíží a zrychlení detekce problémů Zvažte jednotné řešení, jako je Azure Log Analytics, k dotazování a analýze dat na různých úrovních.
Zarovnejte telemetrii se systémovými a uživatelskými toky pro korelaci stavu těchto toků s celkovým stavem pracovního zatížení. Pochopení těchto toků vám pomůže zajistit, aby strategie pozorovatelnosti odrážela chování systému na úrovni komponent i kompletního systému.
Analýza a vizualizace pro podporu rozhodnutí s možností použití
Navrhněte řídicí panely a sestavy podle modelů provozního zdraví. Vizualizace by měly týmům umožnit rychle identifikovat problémy, porozumět trendům a určovat priority odpovědí.
Model stavu poskytuje sémantickou vrstvu mezi telemetrií a provozními rozhodnutími. Místo řídicích panelů založených na metrikách vizualizujte stavy kondice, které umožňují přejít od kondice na úrovni úlohy ke kondici jednotlivých prostředků. Využijte výhod Azure Monitor modelů stavu k získání integrovaných vizualizací stavu v hierarchii entit a přístupu rozhraní API pro integraci dat o stavu do nástrojů, jako je Grafana.
Používejte osvědčené vzory monitorování a architektury místo vlastních implementací nebo ad hoc řešení. Ujistěte se, že řídicí panely jsou smysluplné a použitelné. Analytici můžou k prozkoumání podkladových dat použít parametrizované řídicí panely.
U databázových úloh vyhodnoťte integrované řídicí panely monitorování, které poskytují cloudové služby. Například Azure Database for PostgreSQL nabízí vestavěné Grafana řídicí panely prostřednictvím integrace Azure Monitor na portálu Azure. Tyto řídicí panely zobrazují využití procesoru, úložiště, aktivní připojení a propustnost dotazů s korelací protokolů a snižují potřebu samostatných nasazení monitorování.
Příležitost umělé inteligence: Řídicí panely se často zaměřují na obchodní nebo technické metriky. AI dokáže analyzovat data ze všech relevantních zdrojů a pomáhá navrhovat integrované řídicí panely se správnou konfigurací a vizualizací. Tento návrh snižuje ruční úsilí a poskytuje přehledy, které by jinak mohly být přehlédnuty.
Definování upozornění ohledně smysluplných provozních podmínek
Nastavte výstrahy na základě stavu úloh, ne na základě libovolných hodnot. Výstrahy by měly být použitelné a měly by poskytovat kontext. Vytvořte jasný a zodpovědný proces upozorňování, který definuje vlastníky, akce a rozsah. Nakonfigurujte výstrahy s odpovídající členitostí a podrobnostmi, abyste minimalizovali šum a současně zajistili, že se rychle zjistí kritické problémy.
Použijte model stavu, který agreguje více korelovaných signálů do stavů, a pak upozorňují na přechody stavu, nikoli na izolované prahové hodnoty metriky.
Ověřte prahové hodnoty na základě minulých zkušeností a pravidelného testování. K rychlému oznámení můžete použít rychlé úložiště pro generování dat výstrah. Nakonfigurujte výstrahy pro dobře definované obory a upravte úroveň podrobností, abyste minimalizovali šum.
Automatizace upozorňování a propojení upozornění na systémy lístků Monitorování stavu, výpadků, údržby a doporučení pro cloudovou platformu
Nástroje pro operace využívající AI, jako je Azure SRE Agent, mohou analyzovat vzory výstrah a diagnostikovat běžné problémy, jako jsou smyčky pádů podů nebo zvýšené míry chyb. Tyto nástroje podporují konfigurovatelnou autonomii, počínaje doporučenými akcemi a postupné povolování automatizovaných odpovědí v rámci definovaných mantinely.
Příležitost AI: Pomocí AI můžete dynamicky určovat „zdravé“ chování systému. Pomocí AI se naučíte vzory napříč obchodními kontexty, jako jsou špičky provozu, propagační akce, tiché období a regionální varianty. AI pak může analyzovat metriky, protokoly a data incidentů, aby předpověděla problémy a doporučovala prahové hodnoty.
Návrh škálovatelných a trvalých kanálů telemetrie
Systémy pozorovatelnosti musí zpracovávat velké škálování bez kritických bodů nebo ztráty dat. Zahrnuje bufferování, řazení front a škálovatelné cesty příjmu dat, aby se zajistilo zachování toku telemetrie při zatížení.
Ke zvládnutí špiček použijte mechanismy řízení front pro vysoce škálovaná prostředí. Implementujte redundanci, abyste zabránili ztrátě důležitých dat. Naplánujte škálování během návrhu, abyste zajistili, že systémy monitorování rostou s požadavky na úlohy.
U složitých úloh používejte fronty zpráv s aspoň jednou sémantikou. Spusťte několik služeb zápisu do úložiště pro zpracování velkých objemů. Zvažte použití služby Azure Event Hubs k distribuci zpracování telemetrie a k zamezení úzkým místům I/O v jediném bodě.
Použití pozorovatelnosti k podpoře průběžného vylepšování
Zacházejte s pozorovatelnostmi jako se smyčkou zpětné vazby. Pomocí produkčních dat můžete upřesnit návrh úloh, zachytávání telemetrie a monitorování prahových hodnot.
Vyvážení automatizace a lidského dohledu za účelem zajištění přesnosti Průběžně kontrolujte a vyvíjejte přístupy k monitorování vzhledem ke změnám vytížení. Pomocí telemetrie můžete identifikovat příležitosti optimalizace, ověřit rozhodnutí o architektuře a řídit budoucí návrhy.
Zahrnutí monitorování a upozorňování do celkového testování úloh Automatizujte funkce a udržujte možnost analyzovat trendy pro predikci provozních problémů a plánování kapacity.
Dávejte pozor na antipatterny
Řada selhání monitorování vychází z špatných možností architektury, nikoli z omezení nástrojů.
Neopravujte jen příznaky, ale analyzujte, proč se antipattern objevil, a odstraňte základní slabinu návrhu. Pak použijte zmírnění rizik, ať už používáte jasné standardy telemetrie, nasměrujte se k metrikám sladěným s firmou nebo ke zvyšování povědomí o nákladech.
Tento oddíl doporučujeme přečíst v doprovodné příručce k implementaci: Antipatterny a jak se jim vyhnout.
usnadnění Azure
Azure Monitor je monitorovací řešení pro shromažďování, analýzu a reagování na data monitorování z vašich cloudových a místních prostředí.
Modely stavu v Azure Monitoru vám pomáhají definovat, měřit a vizualizovat stav pracovního zatížení tím, že korelují metriky, protokoly a trasování do stavů kondice, na jejichž základě lze jednat, napříč prostředky a komponentami Azure.
Log Analytics je nástroj na portálu Azure, který můžete použít k úpravám a spouštění dotazů protokolu na data v pracovním prostoru Log Analytics.
Pokud používáte více pracovních prostorů, přečtěte si průvodce architekturou Log Analytics pracovního prostoru o osvědčených postupech.
Application Insights je rozšíření Azure Monitor. Poskytuje funkce APM.
Azure Monitor Insights jsou pokročilé analytické nástroje pro konkrétní technologie Azure (jako jsou virtuální počítače, aplikační služby a kontejnery). Tyto nástroje jsou součástí Azure Monitor a Log Analytics.
Azure Monitor pro řešení SAP je nástroj pro monitorování Azure pro prostředí SAP, který běží na Azure.
Azure Policy vám může pomoct vynutit standardy organizace a posoudit dodržování předpisů ve velkém měřítku.
Azure Network Watcher je nástroj, který monitoruje, spravuje a audituje vaši síť, aby zajistila zabezpečení, dodržování předpisů a výkon.
Řešení potíží s připojením je diagnostický nástroj v Network Watcher. Poskytuje diagnostiku na vyžádání a zachytávání paketů (PCAP), které pomáhají zkoumat problémy s připojením.
Monitorování připojení je monitorovací nástroj v Network Watcher. Spouští průběžné syntetické testy a odesílá upozornění na problémy s připojením a výkonem v reálném čase.
Traffic analytics je řešení analýzy provozu v Network Watcher. Vizualizuje distribuci provozu, identifikuje hlavní talkery a ukazuje trendy využití šířky pásma. Tyto funkce poskytují jednotný přehled o stavu sítě.
Protokoly toku virtuální sítě teď mají nativní konektor Microsoft Sentinel, který exportuje telemetrii sítě do SIEM vaší organizace. Tato integrace přináší toky dat do stejné analytické roviny jako signály identit a koncových bodů, což zlepšuje korelaci během vyšetřování zabezpečení. Mějte pod kontrolou objem logů a náklady na analýzy při škálování ingestace dat
Související odkazy
- Průvodce instrumentací
- Doporučení pro návrh spolehlivé strategie monitorování a upozorňování
- Doporučení pro monitorování a detekci hrozeb
- Doporučení pro shromažďování dat o výkonu
Komunitní odkazy
- Azure Monitor výstrahy základní linie (AMBA) je centrální úložiště definic výstrah, které mohou zákazníci a partneři využít ke zlepšení zkušeností s dohledem prostřednictvím používání Azure Monitor.
Kontrolní seznam pro efektivitu provozu
Projděte si kompletní sadu doporučení.