Azure 監視器 問題

Azure Copilot 可觀察性代理程式協助您識別、調查並解釋服務品質下降。 當這類退化發生時,你通常會想保留上下文,與團隊分享發現,並持續持續努力解決問題。

問題是讓這項功能成為可能的持續性記錄。 它能將相關訊號集中在一起,並讓團隊有共享空間繼續排查故障,而不必從各自的警示、資源或調查會議重新開始。

問題與警示

警示和問題有不同的目的。

警報代表在資源上觀察到的特定訊號。 當被監控的資料符合警報規則的條件時,它就會被觸發。

問題是用於調查、管理及解決服務效能下降的持續性記錄。 警示有助於識別個別症狀,而問題則幫助團隊理解並管理更廣泛的營運問題。 單一問題可跨越多個警示與資源,提供事件整個生命週期的統一視圖。

問題是如何產生的

你可以用兩種方式製造問題:

  • 當您想要從 Observability Agent 調查所產生的內容繼續工作時,可從深入調查開始。 關於使用者啟動的調查路徑,請參見Azure Copilot可觀察代理程式中的深度調查
  • 當 Azure Copilot Observability Agent 在背景執行自主作業時,便會自主執行。 視您的組態而定,Agent 可以將相關警示相互關聯為單一事件以建立問題,或將個別顯著警示提升為問題。 關於背景相關路徑,請參見Azure Copilot可觀察代理中的自主操作

每個問題都儲存在 Azure 監視器 Workspace (AMW) 下。

你需要在 Azure 監視器 Workspace 中使用 貢獻者監控貢獻者或 問題貢獻 者角色來建立問題。 如需角色管理的詳細資訊,請參閱使用 Azure 入口網站指派 Azure 角色 (部分機器翻譯)。

問題包含的內容

問題會保留服務降級的內容,從初始偵測移至持續調查與回應。 根據該期刊的產生方式,可能包括:

  • 問題中繼資料,例如標題、嚴重性、狀態和影響時間。
  • 背景資訊,總結該問題、其影響,以及迄今為止所蒐集到的背景脈絡。
  • 調查由 Azure Copilot 可觀察性代理程式執行,包括調查結果、分析、建議的下一步,以及透過可觀察性代理程式持續細化調查的能力。
  • 與此問題相關的警示
  • 受此議題影響或相關的相關資源

此模型使議題成為代理主導調查與人工回應工作流程之間的持久交接點。

檢視議題

您可以在以下地點查看議題清單:

  • Azure 監視器 — 顯示所有 Azure 監視器 工作空間(AMW)在所選訂閱下的問題。
  • Azure 監視器 Workspace — 顯示儲存在特定 AMW 中的問題。

Azure 監視器 工作區作為問題容器

Azure 監視器工作區 (AMW) 可作為問題的容器。

你可以將 AMW 設定為訂閱中所有議題的預設容器。 當您設定預設 AMW 時,當該訂用帳戶中的資源觸發警示時,調查程序會將問題儲存在相同的工作區中。 將它們儲存在同一工作區,有助於確保所有相關問題都能在一致的位置儲存和管理。

欲了解如何將訂閱與 Azure 監視器 工作空間關聯,請參閱使用 Azure 監視器 問題

以下是一個 AMW 中問題的範例。

Azure 監視器 工作區中出現問題的截圖。

問題動作

當議題被建立或更新時,議題動作能讓你在回應流程的那個階段觸發通知或自動化工作流程。 由於行動基於相關且豐富的議題,而非個別警示,因此包含整合的脈絡:嚴重性、受影響的資源與調查結果。 這讓下游工作流程能獲得足夠資訊,以套用針對性且一致的回應,而非對孤立訊號做出反應。

通知何時觸發

通知會在以下情況下發送:

  • 新問題會被產生 ——可能是因為被保存的調查結果,或是由自主代理人所為。
  • 當問題的嚴重性或狀態改變時,現有議題會被更新

支援的動作類型

支援以下動作類型:

  • 電子郵件(個人收件人或 Azure Resource Manager 角色)
  • SMS/文字訊息
  • Voice
  • Logic Apps
  • 事件中樞
  • Azure Functions
  • 自動化運行手冊
  • 安全 Webhook(用於連線至 ServiceNow)
  • Webhook

設定動作

透過儲存該問題的 Azure 監視器 工作區(AMW)上的動作群組來設定動作。 你可以設定一個或多個動作群組作為該工作區的預設動作。

當問題被建立或更新時,相關 AMW 上設定的動作群組會自動觸發。

你也可以透過Azure Copilot可觀察代理資源配置來定義動作。 欲了解更多資訊,請參閱Azure入口網站中的「建立Azure Copilot可觀察代理資源」。

欲了解更多行動團體資訊,請參閱 行動團體

範例情境

以下範例說明議題行動如何支持不同的回應情境:

  • 與ServiceNow協調技術調查與事件管理。 透過安全 webhook 將問題傳送到 ServiceNow ITOM。 Azure 監視器問題仍是值班工程師的技術工作區,其中包含相關警示、資源,以及可檢視性 Agent 的調查結果。 相應的 ServiceNow 警示和 ITSM 事件支援指派、升級處理、溝通及結案。 啟用雙向同步後,相關狀態變更會在兩個系統間保持一致。

  • 工單建立與工作流程整合 — 當問題建立或更新時,使用 Logic App 在 Azure DevOps 或 Jira 等系統中建立或更新工作項目。 工作項目可包含問題細節,如嚴重程度、受影響的資源及營運背景,幫助團隊追蹤所有權、協調工作,並透過現有工程流程管理解決方案。

  • 智慧路由 — 使用 Azure 函式或邏輯應用程式檢查問題屬性,如嚴重性、受影響的服務或受影響的資源,並將問題導向適當的團隊、通道或工作流程。 例如,將影響面向客戶的應用程式問題導向待命工程團隊,而將影響內部系統的問題導向不同的營運工作流程。

  • 將議題資料串流至下游系統 — 將議題生命週期事件傳送至 Azure 事件中樞,由外部系統處理。 使用此方法來支援自訂儀表板、作業分析、報告管線、Data Lake,或會將問題資料與其他作業訊號一併耗用和分析的內部平台。