OpenText 主页。
技术主题

什么是事故预防?

了解 AIOps 和可观测性如何帮助 IT 团队预防事件,而不仅仅是被动应对

概述

以深蓝色电路板为背景,展现色彩斑斓的光纤光流的数字数据传输概念图

事件预防是指利用可观测性、服务上下文和人工智能,在事件影响用户之前就将其遏制,而不是事后更快地解决它们。

它基于四项能力,每项能力都建立在前一项的基础上:

  • 对环境中实际存在情况的可靠描绘
  • 以关键事项为中心的可观测性
  • 快速根因分析
  • 受管控的自动化修复

事故预防

事故预防有哪些好处?

  • 减少停机时间和平均修复时间(MTTR):及早发现成型问题,缩短查找根本原因所需的时间。
  • 释放团队潜力:减少战情室数量并降低手动关联工作量,让工程师将时间投入到更高价值的工作中,而不是忙于处理警报。
  • 加强安全防护能力:既能加快根本原因分析进程,又能更快地发现未经授权或存在风险的变更的变更与配置环境。
  • 加强合规性:全面的日志记录和审计追踪有助于更轻松地证明对 IT 变更和事件的控制。
  • 降低停电成本:故障次数减少、持续时间缩短,意味着对收入的影响较小,且计划外的人工成本也随之降低。
  • 逐步建立对自动化的信任:受管控且包含人工干预的自动化,能够随着时间的推移赢得必要的信任,从而逐步扩大自动化程度。

事件预防的四个层面是什么?

预防并不是一个单独的功能。如果不了解问题的可能原因,就无法自动解决问题。如果没有正确的可观测性数据,就无法找出合理原因。如果不了解周围环境中存在什么以及这些环境能提供什么,你就无法观察到真正重要的东西。每一层都为下一层提供支撑。

  • 真相之基:一张始终保持最新、便于查询的地图,全面展示跨应用程序、基础设施和网络的服务及其依赖关系;该地图基于自动发现机制构建,并由人工智能保持数据准确性,而非依靠人工维护的记录。这一生活服务模式是其他一切的基础。
  • 优先级明确、集成化的可观测性:根据哪些资产支持哪些业务服务,将遥测范围聚焦于最重要的方面。正是在这里,成型问题会在触发阈值之前被标记出来。
  • 关联与根本原因:通过自动化事件关联,基于完整上下文进行推理,在数分钟内找出可能的原因,并提供置信度评分和可追溯的推理逻辑,而非零散的独立警报。
  • 自动化解决:基于受管运行手册和策略的自动化机制,可在信号出现的第一时间执行经过验证的修复措施,并与您现有的脚本、操作手册和工具无缝协作。
说明事件预防流程的示意图:可观测性、根本原因分析和自动化修复

了解事故预防为何重要


事件预防与传统的事件响应有何不同?

传统 IT 运维的考核标准是 MTTR,即发生故障后恢复的速度。一旦平台能够预判事态发展,在几分钟内指明可能的原因,并在治理机制下采取行动,那么这种措施就是错误的。事件预防将衡量标准从“清理速度有多快”转变为“从源头上避免了多少事件以及节省了多少应急指挥室工作时间”。

传统回应 事故预防
故障后检测 在碰撞前检测
MTTR 重点 事故预防重点
反应性 积极主动
人工调查 人工智能辅助的相关性分析

人工智能在事故预防中发挥什么作用?

人工智能渗透到事件预防的各个层面,尽管其在不同职能中的作用各不相同。

  • 检测:机器学习模型会标记异常情况,并将相关事件关联起来形成一个整体视图,从而在触发阈值之前就发现正在形成的问题。
  • 诊断:人工智能通过分析拓扑结构、近期变更和遥测数据来识别可能的根本原因,通常会给出一个置信度评分,操作员可以对此提出疑问并加以调整。
  • 解决方案:人工智能能够将诊断结果与自动化流程相连接,从而发现或制定补救措施。大多数组织在这个阶段仍会让人参与其中,并随着对系统的信任度提高而逐步扩大系统的自主权。

各平台的成熟度差异显著,即使在同一平台内部,基于人工智能的诊断和问题解决技术也往往比对尚未触发警报的问题进行完全自主检测的技术更为成熟。


在事件预防中,网络为何如此重要?

大部分事件都源于该网络或经由该网络传输,因此,要使根本原因分析具有可信度,就必须对交易进行端到端的追踪。这使得网络成为基础性输入,而非应用程序和基础设施之后才考虑的次要因素。

这对自动化解决层而言也尤为重要。安全的自动化修复依赖于验证、回滚、策略防护措施、漂移修复以及变更计划生成,这些功能均包含在网络自动化中。Gartner的SRE技术成熟度曲线将主动式网络运维视为对网络自动化的增强而非替代,其实施标准也与这些能力直接对应。简而言之,人工智能就是推理能力;而网络自动化则使其能够安全地采取行动。


企业在构建事件预防机制时面临哪些挑战?

  • 数据分散:应用程序、基础设施和网络遥测数据通常存储在各自独立的工具中,彼此之间缺乏共享的上下文。
  • 过时的服务记录:一旦环境发生变化,手动维护的CMDB就会立即过时,从而动摇了其上构建的一切。
  • 警报疲劳:如果未能根据业务影响进行优先级排序,团队就会在尚未针对重要事项采取行动之前,就被海量信息淹没。
  • 在自动化领域赢得信任:团队理所当然地希望先看到自动化能够正确且可预测地运行,才会考虑扩大其自主操作的范围。

在这方面运作得当的组织通常会先打好基础(即采用当前可靠的服务模式),然后再逐步引入自动化;随着自动化范围的扩大,仍会让人类参与其中;并且会选择能够与现有系统集成、而非要求彻底替换现有系统的工具。


OpenText 如何帮助预防事件?

OpenText 目前已实现事件预防的全部四个层面,并得到了电信、金融服务及其他行业客户实际成效的印证。

我们能提供什么帮助?

脚注