AIOA Aegis / 业务影响优先的 AIOps 决策平台

设备告警之后,如何判断哪些业务受到影响?

某个设备异常时,运维团队先核对相关业务探针与正式依赖,再结合监控问题、资产和拓扑缩小调查范围。巡检或助手提供可复核证据与建议,人员据此决定处置。正式依赖需要人工确认;探针结果和证据不足时,不应把“未识别影响”解释为“现场没有故障”。

工作流程

  1. 确认业务探针与正式依赖
  2. 结合问题、资产与拓扑查看范围
  3. 采集证据并进行辅助研判
  4. 分配处置责任,复核并留存记录
01

先确认业务服务、探针和正式依赖

业务负责人和运维人员先明确要保护的业务服务,再配置探针与确认依赖。设备发现和依赖候选提供整理线索,经过人工确认的正式关系才参与业务判断。关系缺失或探针不可用时,先补齐业务映射或恢复数据采集,再进行影响判断。

02

用问题、资产与拓扑缩小调查范围

发生设备告警后,将 Zabbix 问题、指标与历史记录放回相关资产和业务上下文查看。核对异常是否与业务探针变化相符,并借助拓扑判断关联范围。设备告警与业务中断是不同事实;未识别业务影响也不证明现场没有故障。

03

采集证据,区分已判定与未判定项

通过巡检或受限的助手工具获取可复核证据,再进行判读与续问。采集和解释分开保存,分批失败时保留已取得的部分结果与未判定项。在原始采集证据仍可用、作业状态允许时,可以重新运行解析,不必重复采集。缺少证据或解析失败的项目仍需继续调查。

04

明确处置责任,并在处理后复核业务状态

运维人员结合证据决定处置方式,记录责任、进展与复核结果。助手生成的是建议性变更草稿,审批通过也不会让该草稿由平台自动执行。现有管理或设备配置功能另有权限和操作边界;处理后仍需核对业务探针与相关问题,形成可追溯记录。

现场核查关注这些边界

  • 正式业务依赖经过人工确认,发现候选与正式资产关系保持区分。
  • 原始证据、部分结果与未判定项可识别;未发现业务影响时,仍结合现场证据确认业务状态。
  • 处置权限、现场账号与责任分工明确,建议草稿不被误当自动执行流程。

适合谁

企业 IT 运维团队、信息中心与运维服务商,需要把基础设施异常与业务运行情况结合判断。

部署与边界

支持私有化部署,平台主数据库为 PostgreSQL 与 pgvector。接入监控、资产与现场账号时按权限配置;发现方式、站点范围和采集协议需结合现场条件确认。

建议性变更草稿不会因审批通过而自动执行。平台部分管理与设备配置功能包含写操作,不能把整个平台描述为只读。示例不代表生产验收或全行业覆盖。

AIOA Aegis · 了解产品 →

HONGCHUANGDA TECHNOLOGY

联系咨询

三个独立产品,可分别部署;跨产品集成按项目范围确认。

联系咨询