AIOA Aegis / 業務影響優先的 AIOps 決策平臺

裝置告警之後,如何判斷哪些業務受到影響?

某個裝置異常時,運維團隊先核對相關業務探針與正式依賴,再結合監控問題、資產和拓撲縮小調查範圍。巡檢或助手提供可複核證據與建議,人員據此決定處置。正式依賴需要人工確認;探針結果和證據不足時,不應把“未識別影響”解釋為“現場沒有故障”。

工作流程

  1. 確認業務探針與正式依賴
  2. 結合問題、資產與拓撲檢視範圍
  3. 採集證據並進行輔助研判
  4. 分配處置責任,複核並留存記錄
01

先確認業務服務、探針和正式依賴

業務負責人和運維人員先明確要保護的業務服務,再配置探針與確認依賴。裝置發現和依賴候選提供整理線索,經過人工確認的正式關係才參與業務判斷。關係缺失或探針不可用時,先補齊業務對映或恢復資料採集,再進行影響判斷。

02

用問題、資產與拓撲縮小調查範圍

發生裝置告警後,將 Zabbix 問題、指標與歷史記錄放回相關資產和業務上下文檢視。核對異常是否與業務探針變化相符,並藉助拓撲判斷關聯範圍。裝置告警與業務中斷是不同事實;未識別業務影響也不證明現場沒有故障。

03

採集證據,區分已判定與未判定項

透過巡檢或受限的助手工具獲取可複核證據,再進行判讀與續問。採集和解釋分開儲存,分批失敗時保留已取得的部分結果與未判定項。在原始採集證據仍可用、作業狀態允許時,可以重新執行解析,不必重複採集。缺少證據或解析失敗的專案仍需繼續調查。

04

明確處置責任,並在處理後複核業務狀態

運維人員結合證據決定處置方式,記錄責任、進展與複核結果。助手生成的是建議性變更草稿,審批透過也不會讓該草稿由平臺自動執行。現有管理或裝置配置功能另有許可權和操作邊界;處理後仍需核對業務探針與相關問題,形成可追溯記錄。

現場核查關注這些邊界

  • 正式業務依賴經過人工確認,發現候選與正式資產關係保持區分。
  • 原始證據、部分結果與未判定項可識別;未發現業務影響時,仍結合現場證據確認業務狀態。
  • 處置許可權、現場賬號與責任分工明確,建議草稿不被誤當自動執行流程。

適合誰

企業 IT 運維團隊、資訊中心與運維服務商,需要把基礎設施異常與業務執行情況結合判斷。

部署與邊界

支援私有化部署,平臺主資料庫為 PostgreSQL 與 pgvector。接入監控、資產與現場賬號時按許可權配置;發現方式、站點範圍和採集協議需結合現場條件確認。

建議性變更草稿不會因審批透過而自動執行。平臺部分管理與裝置配置功能包含寫操作,不能把整個平臺描述為只讀。示例不代表生產驗收或全行業覆蓋。

AIOA Aegis · 瞭解產品 →

HONGCHUANGDA TECHNOLOGY

聯絡諮詢

三個獨立產品,可分別部署;跨產品整合按專案範圍確認。

聯絡諮詢