专场:智能运维与 SRE 变革:Agent 驱动的稳定性保障
在系统架构持续演进、业务复杂性指数级攀升的今天,大模型的应用催生了AgentOps新范式,运维与SRE正经历从人工值守向Agent-driven的根本性跨越。以大模型、AIOps为核心的AI技术深度渗透,正在重构DevOps故障排查核心工作流。面向未来的系统,将是智能体深度嵌入的可编程自治体系。以LLM+Agent为大脑的智能体运维框架,正在成为保障系统稳定性的核心引擎。本次专场,我们将聚焦Agent驱动的稳定性保障。重点剖析AI与DevOps融合在稳定性保障中的实际价值,深入探讨智能体运维(AgentOps)在真实业务场景中的落地应用,并解读传统运维人员向智能运维专家转型的关键路径。我们将携手探索在Agent驱动下,构建更可靠、更高效的运维新未来。
专场出品人:付求爱 
华为云 AIOps技术负责人、研发智能体技术专家
华为云AIOps技术负责人、研发智能体技术专家,带领团队从零构建华为云租户面智能化运维能力,负责CodeArts码道上下文管理和记忆能力的建设,具备丰富的智能化研发领域从业经验,带领团队完成多项智能化研发关键能力构建和技术研究;发表专利20余篇,在FSE、ICSE、ASE等行业顶级会议上发表多篇论文;在AIOps和研发智能体领域具有丰富管理和实践经验。
闫亚东
阿里云 云原生应用平台高级工程师
阿里云可观测团队高级工程师,长期从事可观测、AIOps 和智能运维方向研发,在分布式链路追踪、监控数据平台和智能化诊断等领域积累了一线研发与工程落地经验。目前主要负责阿里云全域智能运维平台 STAROps 的根因诊断(RCA)方向,聚焦将 Agent 技术应用于复杂故障的自动化定位、证据分析与诊断,提升故障排查效率和诊断结果的准确性。
待定
待定
基于统一数据建模的根因诊断:Agent 在图上的故障定位实践
议题背景:
大规模微服务和云原生架构下,一次故障常常同时牵涉应用、容器、数据库、中间件和云资源。随着大模型和 Agent 进入运维场景,越来越多团队开始尝试让 Agent 参与告警分析、故障定位和诊断报告生成,希望把资深工程师的排障经验转化为可持续运行的自动化能力。但 RCA 场景对可信度要求很高,传统排障高度依赖专家经验,把排查套路固化为规则或 Skill 只能覆盖已知路径,面对跨层依赖和复合故障时容易失效;直接让 Agent 自由排查,也会带来相关性误判、工具调用范围失控、诊断成本高和结论不可复核等问题。

本次分享介绍我们的 RCA Agent 实践:将服务、Pod、数据库等实体及其观测数据指标、日志、Trace、事件和变更组织成带语义的实体关系图,再让 Agent 沿图限定调查范围、检索证据、验证传播路径,区分现象、影响面和根因。分享还会介绍如何用可复现的 Benchmark 和数据回放持续评估诊断准确率、耗时和稳定性,让 RCA 的效果可以被量化比较和持续改进。

内容大纲:

1. 背景:大模型进入运维后的现实挑战
1.1 私有系统上下文不足  
1.2 运维判断容易停留在相关性  
1.3 企业级排障链路复杂  
2. 核心矛盾:运维数据丰富,但语义组织不足
2.1 多源数据割裂  
2.2 数据归属不清  
2.3 关系表达不足  
2.4 知识缺少上下文  
3. 解法:基于图模型的可观测数据建模
3.1 实体与关系建模  
3.2 数据与知识关联  
3.3 统一查询与上下文组织  
3.4 模型更新与维护  
4. 基于图模型的 RCA Agent
4.1 LLM 与实体模型的职责分工  
4.2 问题理解与实体定位  
4.3 实体上下文检索  
4.4 基于实体关系图的诊断推理  
4.5 根因结论与证据链生成  
5. RCA Agent 的评估与生产可用性
5.1 Benchmark 环境建设  
5.2 根因准确性评估  
5.3 从 Benchmark 环境到生产环境
6. 总结

听众收益:
1. 建立对统一实体建模 / Ontology 的具体认识,以及在运维场景的价值;
2. 了解 Agent 基于图进行根因诊断的实现思路,以及它的优势;
3. RCA Agent 的评估方法。
梁成琰
去哪儿旅行 devops 资深架构师
去哪儿网基础架构团队资深架构师,目前主要负责稳定性治理体系的工具建设,主导了根因分析系统、预案系统从0到1的搭建,负责公司监控系统的建设,保障其性能可靠性和稳定性。
待定
待定
指标血缘定界,AI 推理定位:根因分析架构演进之路
议题背景:
在复杂微服务业务系统中,根因分析的最大瓶颈,往往不在于 “有没有 AI 能力”,而在于**故障问题边界能否被精准锁定**。随着云原生架构普及,业务调用链路愈发庞杂,传统依靠专家经验、静态权重规则的根因分析方案逐渐暴露出短板:仅能做异常信息排序,缺少指标间因果推理能力,海量告警噪声淹没有效信号,定位准确率持续衰减,即便输出候选 Top5 故障列表,依然需要大量人工二次排查。

直接寄希望于大模型、纯 AI Agent 来解决问题同样会踩坑:脱离结构化的依赖拓扑数据,AI 会面临搜索空间爆炸、跨应用推理深度不足、幻觉误判率高等现实问题,无法直接胜任复杂生产故障定位。
议题背景

本次分享结合去哪儿旅行真实生产落地实践,完整复盘根因分析系统的四版架构演进。我们先通过**指标血缘补齐可观测体系的因果短板**,结合 Trace 调用链完成故障范围定界收敛,把 AI 的搜索空间从数百个应用压缩至极小范围;再在收敛后的边界内,融合 AI Agent 开展定向证据链推理,输出可解释的 Top1 根因结论与处置建议。同时分享指标血缘构建思路、AI 落地试错教训,以及生产落地效果与未来多智能体协同演进方向,给复杂业务下智能故障根因平台建设提供可参考的实践经验。

内容大纲:
1. 起点困局:传统权重式根因分析的能力天花板
服务云原生架构下故障链路复杂,基于人工经验权重的 1.0 系统,仅能做异常排序,缺少因果推理;随系统稳定性提升,准确率持续下滑,Top5 结果仍充斥大量无关干扰信息,人工排查成本高。
2. 试错踩坑:两次 AI 落地实践的失败复盘
先后尝试 LLM 摘要美化输出、纯 AI Agent+RAG 知识库两套方案。LLM 仅润色文案不产生推理;纯 Agent 在跨多应用场景存在搜索空间爆炸、幻觉高、推理深度不足的问题,验证了脱离结构化数据的 AI 无法独立完成根因定位。
3. 破局核心:指标血缘补齐可观测因果短板,完成故障定界
构建 AST 静态分析 + Trace 动态采样的指标血缘体系,厘清总分、依赖两类指标关系;结合 Trace 调用链,把故障候选范围从数百应用做收敛,区分故障源头和被动受影响服务,解决 AI 搜索空间过大难题。
4. 架构融合:血缘定界 + AI Agent 推理,实现 Top1 根因输出
演进 4 代技术架构:传统权重→LLM 摘要→纯 AI Agent→血缘 + AI 融合。由指标血缘完成边界圈定,AI Agent 在收敛后的范围内开展定向证据链推理,输出带置信度的 Top1 唯一根因结论与处置建议。
5. 落地效果与未来规划
生产落地后根因分析准确率从 50% 提升至 85%;分享真实线上故障定位案例;展望多智能体协同、知识库自进化、飞书机器人运维交互的后续建设方向。

听众收益:
1. 了解根因分析完整演进路径,搞懂指标血缘、Trace、AI Agent 三者的协同逻辑,理解为什么 AI 不能脱离前置数据定界直接做故障推理。
2. 吸收去哪儿网生产踩坑经验,掌握微服务复杂环境下 AI 根因平台建设思路,规避大模型幻觉、跨应用推理失效等常见问题。
3. 可借鉴指标血缘的构建方案,用于在现有可观测体系内,低成本提升故障定位准确率、缩短排障耗时。
陈乔
华为云 HCS智能运维架构师 
当前供职华为云HCS技术开发部智能运维专家,深耕政企云基础设施运维与AIOps领域多年,具备丰富的平台架构演进与商用落地经验。主导HCS智能运维平台架构设计与技术革新,率先将大模型与知识图谱技术引入运维场景,攻坚多模态根因定位与运维Copilot智能助手,实现告警降噪超90%、故障恢复提速40%的显著突破。在商用交付方面,牵头金融、政务等多个重大项目的智能运维方案落地,推动AIOps能力在数百个政企节点的规模化商用,有效保障海量云底座的高可用与极致SLA。
未来规划聚焦大模型在复杂云原生场景的深度应用演进,致力于打造自愈合、自优化的下一代自动驾驶云运维体系,推动运维智能化迈向新高度。

待定
待定
基于工单蒸馏 SRE 经验,构建故障快恢知识图谱
议题背景:
当前AIOps成功实践集中在租户侧数据面,得益于K8s标准化架构和OpenTelemetry可观测性标准,大模型天然适配。然而混合云管控面是运维智能体的"修罗场"——异构架构(虚拟机+容器+裸金属混合)、非标可观测性、开源大模型对专有云架构语料极度匮乏,导致直接套用大模型解决管控面故障几乎不可能。核心矛盾在于:管控面的运维知识是“暗知识”,存在于SRE工程师的经验和运维wiki文档中。我们提出借助参考案例、工单、故障模式库等知识,将SRE经验蒸馏为知识型Skill,以五层知识图谱结构注入大模型,实现混合云管控面的故障自动定界。

内容大纲:
1. 为什么管控面是AIOps的"修罗场"
1.1 租户侧数据面 vs 混合云管控面的架构鸿沟
1.2 大模型知识真空:从"理想国"到"修罗场"的落差分析
2. 破局之路: 蒸馏sre经验为运维skill包
2.1 双层灵活性:SOP精准定界 + 原子能力自主定界
2.2 为什么选择Skill而非传统知识图谱:从复杂逻辑到朴素reference文档
3. 五层知识图谱的设计灵魂与工程实现
3.1 Layer 1 快速映射层:确定性路由,不让大模型"自由发挥"
3.2 Layer 2 架构知识层:教会大模型"故障沿调用链传播"
3.3 Layer 3 SOP流程层:诊断项+判断项的确定性决策树
3.4 Layer 4 原子能力层:可自由组合的最小诊断单元(40+命令/463行日志/242行告警/247行指标)
3.5 Layer 5 输出规范层:证据链机制确保可追溯可验证
4. SOP+ReAct双模诊断机制
4.1 标准SOP诊断:已知故障走"确定性高速公路"
4.2 自主规划诊断:未知故障用原子能力"搭积木"
4.3 三要素协同:架构知识+原子能力+SOP范式如何让大模型"学会"推理

5. 实战案例与效果验证
5.1 ECS虚拟机磁盘迁移失败诊断:SOP未覆盖场景下的自主规划定界全过程
5.2 10分钟完成组件级故障定界的效率分析

听众收益:
1.掌握一套可落地的"知识图谱Skill"设计方法论——五层知识图谱结构、SOP+ReAct双模诊断机制、PageIndex上下文压缩策略,可直接借鉴应用于自身领域的AI Agent知识注入工程实践。
2.获得大模型在非标准化运维场景落地的关键踩坑经验——包括如何避免大模型"自由发挥"、如何解决上下文爆炸、如何让大模型在SOP未覆盖时仍能自主推理,这些经验在金融、通信等非标基础设施场景同样适用。
3.了解从手工蒸馏到知识飞轮的演进路线——如何从多源数据(代码/文档/工单)自动生成Skill,以及如何构建"诊断→反馈→优化"的闭环自进化机制,为大规模推广提供可复制的路径。

李赛
携程 高级研发经理
主要负责携程AIOps技术体系建设, 包括多Agent系统、后训练技术、智能告警、智能变更、容量治理、应用治理、根因定位等场景下的AIOps探索与实践,在人工智能技术结合运维场景方面有深入研究。多次分享技术主题,获得QECon明星讲师、GOPS金牌讲师、携程技术中心优秀讲师、GOITI大模型运维领域年度技术专家等称号,其负责项目获得中国信通院“云服务运行安全创新成果奖”。
待定
待定
从 AIOps 到 AgentOps 的思考与设计实现
议题背景:
当前运维面临告警风暴、数据孤岛、人工排障效率低三大核心挑战,导致MTTR(平均恢复时间)居高不下。我们期望通过构建多Agent协同运维系统,能够自动的对告警进行全方位的告警分析、数据处理、知识沉淀,实现告警从“被动响应”到“主动预防”的跃升,最终降低MTTR。

内容大纲:
1. 背景
2. 大模型的技术路线与能力跃迁
3. AgentOPS设计与实现
3.1 编排层设计与实现
3.2 BenchMark与数据飞轮:如何构造数据集与评估
3.3 记忆模块设计: 借助记忆层增强系统能力
4 后续与展望

听众收益:
1. 了解到多agent系统的设计要点
2. 了解模型选型时候的一些参考要点
3. 如何将多agent运维系统真正在企业落地

关注QECon公众号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
135-2067-8913  媛媛
媒体合作
135-1619-6409  皮皮
添加QECon小助手,获取
会议最新资讯
购票咨询
13520678913  媛媛
服务总线
400-183-9980  
电话咨询
联系电话:
13520678913 媛媛