OpsGraph-RCA:多源可观测性与拓扑增强微服务根因诊断

联合指标、日志、调用链与服务拓扑,先定位微服务故障候选,再用门控融合和大模型报告解释诊断依据。

  • 技术与任务大模型与智能体 · 时序与信号 · 多模态与多源融合
  • 应用方向信息与人工智能

项目亮点

  • 多种异常信号怎样对齐
  • SafeFusion 为什么使用门控
  • 排序评价与报告生成各做什么

数据与任务

样本量RCAEval · 360 起故障案例
核心方法SafeFusion · 拓扑门控
技术栈Python · Qwen3

一个服务变慢,往往会带着多个下游服务一起报警。这个项目围绕“谁先出了问题、谁只是被影响”展开,把系统指标、日志和调用链变成可比较的证据,再利用服务依赖关系定位根因。

flowchart LR N0["指标 · 日志 · 调用链"] N1["异常评分与候选服务"] N2["拓扑门控融合"] N3["根因排序"] N4["大模型诊断报告"] N0 --> N1 --> N2 --> N3 --> N4

先说清楚,它到底在做什么

项目使用 RCAEval RE2/RE3 的 360 起故障案例。指标显示异常幅度,日志补充事件线索,调用链呈现请求传播,拓扑描述服务之间的依赖。它们的信息强弱并不一致,因此需要先构建可靠的指标锚点,再决定其他证据是否值得加入。

真实事故样本总览
真实事故样本总览

搞懂它,你能在面试里讲清楚什么

多种异常信号怎样对齐

将不同来源的证据整理到服务级候选上,才能比较同一次事故中各服务的变化。指标锚点承担基础排序,日志与调用链帮助解释候选是否符合实际故障传播方向。

项目总体方法与模块关系
项目总体方法与模块关系

SafeFusion 为什么使用门控

融合通过残差排序与有向拓扑条件调整候选,只有满足条件的补充证据才改变锚点判断。门控把“有信息”与“对这次诊断有帮助”分开,能够通过消融实验检查每个模块的作用。

SafeFusion安全门控原理图
SafeFusion安全门控原理图

排序评价与报告生成各做什么

根因命中率由排序器计算,大模型读取已经组织的证据生成诊断说明。锁定的 39 例测试集 Top-1 为 0.9744;覆盖 360 例的嵌套分组评价 Top-1 为 0.8694。两种评价口径在技术文档中分别说明。

正式结果与消融对比
正式结果与消融对比

怎样阅读实验与配图

真实事故总览图展示多源证据怎样指向候选服务,门控机制图解释排序如何调整,结果与消融图用于比较各环节贡献。讲解时可选一次事故,把观测、候选、依赖关系和报告连成完整过程。

面试与答辩可以怎样准备

为什么多源证据直接相加可能改变正确的根因排序?

调用方向和异常传播方向如何影响门控?

大模型报告的质量与根因 Top-1 是同一种指标吗?

配套讲解材料围绕整体思路、关键步骤与结果解读展开,并提供面试问答与简历表达参考。准备时可以先按流程说明输入和输出,再选一个样例解释方法,最后用结果图回答具体问题。简历描述结合实际参与内容调整,配图可以放入 PPT 模板组织汇报。

配套资料

技术文档从任务背景、数据组织讲到模型与实验,再结合图表解释结果,包含面试问答和项目表达参考。下面展示正文选页,便于了解讲解内容与图文组织。

技术文档正文节选,第 26 页
技术文档正文节选,第 26 页
技术文档正文节选,第 27 页
技术文档正文节选,第 27 页
技术文档正文节选,第 31 页
技术文档正文节选,第 31 页

代码覆盖数据处理、核心方法和实验分析。下面是实际源码中的关键函数节选,可以结合文档中的流程与公式阅读,再沿输入、计算与输出理解具体实现。

关键实现节选:train_safe_fusion
关键实现节选:train_safe_fusion
关键实现节选:_load_cases
关键实现节选:_load_cases
关键实现节选:_fit
关键实现节选:_fit

适合谁

计算机、软件工程、云计算与智能运维方向,适合关注分布式系统、时序分析及智能体应用的同学。 项目资料可用于学习、选题交流与面试答辩准备;沿着数据、方法、实验和解释逐步掌握,形成能够独立讲清楚的项目经历。

想把这样的项目做成你简历上的亮点?

这是一套配齐了代码、文档、面试问答和配图的 AI+X 项目,可写进简历、在面试里讲清楚。 想做同类项目、或获取「OpsGraph-RCA:多源可观测性与拓扑增强微服务根因诊断」的完整资料(代码 / 数据处理流程 / 论文文档 / 配图), 请联系为你介绍本页面的老师咨询,按你的情况定一个合适的项目。

加载中…