Etapa 4: Configurar a resposta a incidentes no Agente SRE do Azure

Tempo estimado: 10 minutos

Conecte sua plataforma de incidentes e crie um plano de resposta. Quando os incidentes chegam, seu agente investiga e gera automaticamente planos de execução detalhados.

O que você realiza

Ao final desta etapa, seu agente:

  • Recebe incidentes do Azure Monitor, PagerDuty ou ServiceNow
  • Investiga automaticamente incidentes correspondentes
  • Gera planos de execução de IA de suas instruções
  • Coleta evidências e fornece recomendações

Pré-requisitos

Requisito Detalhes
Agente criado Concluir a Etapa 1: Criar seu agente primeiro.
Plataforma de incidentes Azure Monitor (padrão), PagerDuty ou ServiceNow.

Dica

Embora não seja necessário, concluir a Etapa 2: Adicionar conhecimento e a Etapa 3: Conectar o código-fonte aprimora significativamente a resposta a incidentes. Seu agente faz referência aos seus runbooks e correlaciona problemas a alterações específicas no código, transformando investigações genéricas em análises de causa raiz específicas para a equipe.

Conectar sua plataforma de incidentes

Escolha e configure a plataforma de incidentes que sua equipe usa.

Azure Monitor (padrão)

O Azure Monitor se conecta automaticamente quando você cria seu agente. Nenhuma configuração adicional é necessária.

PagerDuty ou ServiceNow

Para conectar o PagerDuty ou o ServiceNow como sua plataforma de incidentes:

  1. Selecione Configurações na barra lateral esquerda.
  2. Selecione Plataforma de Incidente.
  3. Escolha sua plataforma na lista suspensa:
    • PagerDuty: insira sua chave de acesso da API REST.
    • ServiceNow: insira a URL e as credenciais da instância.
  4. Clique em Salvar.

Seu agente agora recebe incidentes de sua plataforma.

Criar um plano de resposta

Crie planos de resposta a partir da tela do construtor de subagentes. Você pode ver quais gatilhos encaminham para quais subagentes.

  1. Selecione Construtor na barra lateral esquerda.
  2. Selecione o Construtor de Subagentes.
  3. Localize o subagente que você deseja lidar com incidentes e selecione o + botão no lado esquerdo.
  4. Selecione Adicionar gatilho de incidente.
  5. Configure o gatilho: defina um nome, selecione níveis de severidade (por exemplo, P1 e P2), escolha o serviço afetado e, opcionalmente, adicione um filtro de palavra-chave de título.
  6. Escolha o nível de autonomia (é recomendável iniciar a revisão ).
  7. Visualizar incidentes correspondentes e, em seguida, selecionar Criar.

O gatilho aparece como um nó conectado ao subagente na tela.

Importante

Quando você conecta uma plataforma de incidentes pela primeira vez, um plano de resposta de início rápido padrão é criado automaticamente. Se você criar seus próprios planos de resposta, o plano de início rápido será executado junto com eles e poderá fazer com que os incidentes sejam roteados para o agente personalizado incorreto ou processados duas vezes. Para evitar conflitos, acesseos planos de resposta a Incidentes do >, alterne para o modo de exibição Tabela e exclua o plano de início rápido.

Para obter o guia passo a passo completo com capturas de tela, consulte o tutorial Configurar um gatilho de incidente.

Planos de resposta exibidos na tela do construtor de subagentes.

O que acontece quando um incidente ocorre

Quando um incidente corresponde ao seu plano, o agente o manipula automaticamente.

  1. Recupera os detalhes do incidente de sua plataforma.
  2. Pesquisa memória para incidentes anteriores semelhantes e documentação relevante.
  3. Executa o plano executando comandos e coletando evidências.
  4. Resumir os achados com marcadores de tempo e recomendações.

Pesquisa de memória mostrando incidentes anteriores e documentação relevante.

Descobertas de exemplo

O exemplo a seguir mostra as descobertas de um incidente de aplicativo de contêiner:

Resumo:

  • O contêiner foi reiniciado por volta de 01:27Z com a memória caindo bruscamente.
  • Configuração atual: 2 Gi memory, 1 CPU, minReplicas=2, maxReplicas=4.

Causa provável: Reinicialização transitória do contêiner (OOM ou implantação).

Ações recomendadas:

  1. Aumente minReplicas para 3-4 para reduzir o impacto da reinicialização.
  2. Revisar as sondas de saúde do contêiner.

Seu agente fornece recomendações acionáveis com base em evidências, não em conselhos genéricos.

Próxima etapa