OpenText 首頁。
技術主題

何謂事故預防?

了解 AIOps 與可觀測性如何協助 IT 團隊預防事件發生,而不僅是被動應對

概述

以深藍色電路板為背景,搭配繽紛多彩的光纖光流,展現數位資料傳輸的概念

事件預防是指運用可觀測性、服務脈絡及人工智慧,在事件影響用戶之前就加以阻止,而非事後更快地解決問題。

它奠基於四項能力,每項能力皆建立在前一項的基礎之上:

  • 對環境中現有狀況的可靠描繪
  • 以關鍵事項為核心的可觀測性
  • 快速根本原因分析
  • 受管控的自動化修復

事故預防

預防事故有哪些好處?

  • 減少停機時間與平均修復時間(MTTR):及早發現成形問題,並縮短找出根本原因所需的時間。
  • 釋放團隊的潛力:減少戰情室的數量並降低手動關聯的作業量,讓工程師能將時間投入於更高價值的工作,而非忙於追蹤警報。
  • 強化您的資安防禦態勢:既能加速根本原因分析,又能更快揭露未經授權或具風險變更的同一套變更與配置環境。
  • 強化合規性:透過全面的記錄與稽核追蹤,可更輕鬆地證明對 IT 變更與事件的管控能力。
  • 降低停電成本:事件次數減少、持續時間縮短,意味著對營收的影響較小,且非預期的勞動力成本也隨之降低。
  • 逐步建立對自動化的信任:受管控且包含人類介入的自動化,能隨著時間推移贏得所需的信任,進而擴大自主程度。

事故預防的四個層面是什麼?

預防並非單一功能。若不清楚問題的可能原因,便無法自動解決該問題。若缺乏正確的可觀察性資料,便無法找出合理原因。若不了解周遭環境中存在什麼,以及這些事物能提供什麼,就無法觀察到真正重要的事物。每一層都為下一層奠定基礎。

  • 真相的基礎:一張橫跨應用程式、基礎架構及網路,涵蓋各項服務及其依賴關係的即時且易於查詢的地圖,此地圖是透過自動偵測建構而成,並由人工智慧維持其準確性,而非仰賴人工維護的紀錄。這個「活的」服務模式,正是其他一切的基礎。
  • 優先級分級且整合的可觀測性:根據哪些資產支援哪些業務服務,將遙測範圍鎖定在最重要的部分。這就是為什麼在觸發閾值之前,系統會先標記出成形問題。
  • 關聯性與根本原因:透過自動化事件關聯功能,在完整情境中進行推論,於數分鐘內找出可能原因,並提供可信度分數與可追溯的邏輯,取代零散的獨立警報。
  • 自動化解決:透過受管制的運行手冊與基於政策的自動化,在警訊出現的瞬間即執行經過驗證的修復措施,並與您現有的腳本、操作手冊及工具無縫整合。
說明事件預防流程的示意圖:可觀察性、根本原因分析與自動化修復

了解為何事故預防至關重要


事件預防與傳統的事件應變有何不同?

傳統的 IT 營運會根據 MTTR(平均修復時間)來評分,也就是發生事件後能多快恢復運作。一旦平台能夠預見情勢發展、在數分鐘內指出合理懷疑的依據,並在治理框架下採取行動,這種措施便是錯誤的。事件預防將評估標準從「清理速度有多快」轉變為「從一開始就避免了多少起事件以及多少個戰情室工時」。

傳統回應 事故預防
故障後偵測 在撞擊前偵測
MTTR 重點 事故預防重點
反應性 積極主動
人工調查 AI 輔助的關聯分析

人工智慧在事故預防方面扮演什麼角色?

人工智慧滲透至事故預防的各個層面,儘管其作用因功能而異。

  • 偵測:機器學習模型會標記異常情況,並將相關事件關聯起來形成整體圖像,在觸發閾值之前及早發現正在形成的問題。
  • 診斷:人工智慧會綜合考量拓撲結構、近期變更及遙測資料來識別可能的根本原因,並通常會提供一個信心分數,操作員可據此提出質疑並進行調整。
  • 解決方案:人工智慧能將診斷結果與自動化流程相連結,藉此發現或制定補救措施。大多數組織在此階段仍會讓人類參與其中,並隨著對系統的信任日益加深,逐步擴大系統的自主權。

各平台的成熟度差異甚大,即使在同一個平台內,由人工智慧驅動的診斷與解決問題的能力,通常也比對尚未觸發警報的問題進行完全自主偵測的技術更為成熟。


在事件預防方面,為何網路如此重要?

絕大多數事件都源自該網路或經由該網路傳輸,而要使根本原因分析具有可信度,必須對交易進行端到端的追蹤。這使得網路成為基礎性的輸入要素,而非僅是應用程式與基礎設施之後才被考慮的次要因素。

這對「自動解決層」而言也至關重要。安全的自動化修復取決於驗證、回滾、政策防護措施、偏移修復以及變更計畫生成等能力,而這些能力皆存在於網路自動化之中。Gartner 的 SRE 技術成熟度曲線將「主動式網路運維」定位為網路自動化的延伸,而非其替代方案,而其執行標準也直接對應於這些相同的能力。簡單來說,人工智慧就是推理能力;而網路自動化則是讓它能夠安全運作的關鍵。


組織在建立事件預防機制時會面臨哪些挑戰?

  • 分散的資料:應用程式、基礎架構和網路遙測資料通常分散在不同的工具中,彼此之間缺乏共通的背景脈絡。
  • 過時的服務記錄:一旦環境發生變化,手動維護的 CMDB 便會立即過時,這將動搖所有建基於其上的系統。
  • 警報疲勞:若未根據業務影響程度進行優先級排序,團隊在尚未能針對重要事項採取行動之前,便會淹沒在資訊洪流中。
  • 在自動化領域贏得信任:團隊理所當然地希望先確認自動化系統能正確且可預測地運作,才會考慮擴大其自主運作的範圍。

能妥善執行此流程的組織,通常會先奠定基礎(即現有且值得信賴的服務模式),再逐步導入自動化;隨著自動化範圍擴大,仍會讓人類保持參與;並選擇能與現有系統整合的工具,而非要求徹底推翻重來。


OpenText 如何協助預防事件發生?

OpenText 目前提供事件預防的全部四個層級,並獲得電信、金融服務及其他產業客戶的實際成效佐證。

我們能如何幫助您?

註腳