Página inicial da OpenText.
Tópicos técnicos

O que é a prevenção de incidentes?

Veja como o AIOps e a observabilidade ajudam as equipes de TI a prevenir incidentes, e não apenas a reagir a eles

Visão geral

Conceito de transferência de dados digitais com feixes de luz coloridos de fibra óptica sobre um fundo de placa de circuito impresso azul escuro

A prevenção de incidentes consiste na prática de utilizar a observabilidade, o contexto do serviço e a IA para impedir que os incidentes cheguem aos usuários, em vez de resolvê-los mais rapidamente após a ocorrência.

Baseia-se em quatro capacidades, cada uma delas construída a partir da anterior:

  • Uma visão confiável do que existe no meio ambiente
  • Observabilidade com foco no que realmente importa
  • Análise rápida da causa raiz
  • Correção automatizada supervisionada

Prevenção de incidentes

Quais são os benefícios da prevenção de incidentes?

  • Reduza o tempo de inatividade e o MTTR: identifique problemas de conformação antecipadamente e diminua o tempo gasto na identificação da causa raiz.
  • Liberte sua equipe: com menos salas de crise e menos correlação manual, os engenheiros passam a dedicar seu tempo a tarefas de maior valor agregado, em vez de ficarem correndo atrás de alertas.
  • Reforce sua postura de segurança: o mesmo contexto de alterações e configurações que agiliza a análise da causa raiz também identifica mais rapidamente alterações não autorizadas ou de risco.
  • Reforçar a conformidade: registros abrangentes e trilhas de auditoria facilitam a demonstração do controle sobre as alterações e os incidentes de TI.
  • Reduzir o custo das interrupções: incidentes menos frequentes e de menor duração significam menor impacto na receita e menores custos com mão de obra não programada.
  • Construa a confiança na automação de forma gradual: a automação controlada e com intervenção humana conquista a confiança necessária para ampliar a autonomia ao longo do tempo.

Quais são as quatro camadas de prevenção de incidentes?

A prevenção não é um recurso isolado. Não é possível resolver automaticamente um problema sem conhecer sua causa provável. Não é possível identificar uma causa provável sem os dados de observabilidade adequados. Não é possível observar o que é importante sem saber o que existe em seu ambiente e o que ele oferece. Cada camada alimenta a seguinte.

  • Base da verdade: um mapa sempre atualizado e de fácil consulta dos serviços e de suas dependências entre aplicativos, infraestrutura e rede, criado a partir da detecção automática e mantido atualizado por IA, em vez de um registro mantido manualmente. É desse modelo de serviço dinâmico que tudo o mais depende.
  • Observabilidade priorizada e integrada: telemetria focada no que é mais importante, com base em quais ativos dão suporte a quais serviços de negócios. É aqui que os problemas de conformação são sinalizados antes que um limite seja atingido.
  • Correlação e causa raiz: correlação automatizada de eventos que analisa todo o contexto para identificar a causa provável em questão de minutos, com índices de confiança e lógica rastreável, em vez de uma série de alertas isolados.
  • Resolução automatizada: automação baseada em playbooks e políticas, que executa medidas de correção comprovadas no momento em que surge um sinal, trabalhando com os scripts, playbooks e ferramentas que você já utiliza.
Diagrama que ilustra o processo de prevenção de incidentes: observabilidade, análise da causa raiz e correção automatizada

Saiba por que a prevenção de incidentes é importante


Em que medida a prevenção de incidentes difere da resposta tradicional a incidentes?

As operações tradicionais de TI são avaliadas com base no MTTR, ou seja, na rapidez com que se recupera após a ocorrência de um incidente. Essa é uma medida inadequada, uma vez que uma plataforma é capaz de identificar situações em desenvolvimento, determinar a causa provável em questão de minutos e agir de acordo com as diretrizes de governança. A prevenção de incidentes muda o foco da avaliação: em vez de se levar em conta a rapidez com que se resolve o problema, passa-se a considerar quantos incidentes e quantas horas de sala de crise se evitam desde o início.

Resposta tradicional Prevenção de incidentes
Detectar após a falha Detectar antes do impacto
Foco no MTTR Foco na prevenção de incidentes
Reativo Proativo
Investigação manual Correlação assistida por IA

Qual é o papel da IA na prevenção de incidentes?

A IA está presente em todas as etapas da prevenção de incidentes, embora seu papel varie de acordo com a função.

  • Detecção: Os modelos de aprendizado de máquina identificam anomalias e correlacionam eventos relacionados em um único panorama, detectando problemas em formação antes que um limite seja ultrapassado.
  • Diagnóstico: a IA analisa a topologia, as alterações recentes e os dados de telemetria para identificar a causa raiz provável, muitas vezes com um índice de confiança que o operador pode questionar e refinar.
  • Resolução: A IA pode associar um diagnóstico à automação, identificando ou criando etapas de correção. A maioria das organizações mantém um profissional envolvido nessa etapa, ampliando a autonomia à medida que a confiança no sistema aumenta.

O grau de maturidade varia significativamente entre as plataformas e, mesmo dentro de uma determinada plataforma, o diagnóstico e a resolução baseados em IA tendem a estar mais avançados do que a detecção totalmente autônoma de problemas que ainda não tenham acionado um alerta.


Por que a rede é importante na prevenção de incidentes?

Uma grande parte dos incidentes tem origem na rede ou passa por ela, e a análise da causa raiz precisa acompanhar uma transação de ponta a ponta para ser confiável. Isso torna a rede um elemento fundamental, e não um aspecto secundário em relação aos aplicativos e à infraestrutura.

Isso também é importante especificamente para a camada de resolução automatizada. A correção automatizada segura depende da verificação, da reversão, dos limites de política, da correção de desvios e da geração de planos de mudança — recursos que fazem parte da automação de rede. O Ciclo de Hype da Gartner para SRE define as operações de rede agentas como um aprimoramento da automação de rede, e não como uma substituição, e seus critérios de execução correspondem diretamente a esses mesmos recursos. Em termos simples, a IA é o raciocínio; a automação de rede é o que permite que ela atue com segurança.


Quais são os desafios que as organizações enfrentam ao implementar medidas de prevenção de incidentes?

  • Dados fragmentados: a telemetria de aplicativos, infraestrutura e rede costuma estar dispersa em ferramentas distintas, sem um contexto comum.
  • Registros de serviço desatualizados: uma CMDB mantida manualmente fica desatualizada no momento em que o ambiente sofre alterações, o que compromete tudo o que foi construído com base nela.
  • Fadiga de alertas: sem uma priorização vinculada ao impacto nos negócios, as equipes ficam sobrecarregadas com o excesso de informações antes mesmo de poderem agir sobre o que realmente importa.
  • Conquistando a confiança na automação: as equipes, com razão, desejam ver a automação funcionando de maneira correta e previsível antes de ampliar o escopo das ações que ela pode realizar de forma autônoma.

As organizações que atuam dessa maneira tendem a começar pela base (um modelo de serviço atual e confiável) antes de incorporar a automação, mantêm o ser humano envolvido à medida que o escopo da automação se expande e escolhem ferramentas que se integram ao que já utilizam, em vez de exigir uma substituição total.


Como a OpenText pode ajudar na prevenção de incidentes?

A OpenText oferece atualmente todas as quatro camadas de prevenção de incidentes, com base nos resultados alcançados por seus clientes nos setores de telecomunicações, serviços financeiros e outros.

Notas de rodapé