专场:AgentOps:多智能体任务异常监测与诊断
随着大模型智能体从单轮交互走向多智能体协作与长程(Long-Horizon)任务,规划偏差、错误委托、工具调用异常、状态丢失和约束遗漏等问题可能沿执行链持续传播,导致复杂任务失败率居高不下。传统指标、日志与链路追踪往往只能发现最终失败,难以回答异常何时出现、由哪个智能体引入、哪个早期事件构成根因。本分论坛将围绕多智能体任务的运行监测、早期异常检测、责任主体与首个错误步骤定位、长轨迹根因分析、可观测事件模型及诊断评测基准等议题展开讨论,探索构建可追踪、可诊断、可评测、可干预的AgentOps技术体系,为智能体系统的可靠运行与规模化应用提供支撑。
专场出品人:裴昶华
中国科学院计算机网络信息中心副研究员
中国科学院计算机网络信息中心副研究员,国科大杭州高等研究院岗位教授,博士生导师,学位委员会成员,百人计划引进人才,承担国家发改委人机物融合信息基础设施创新与实验平台智能运管创新平台研制建设,中国科学院“十四五”科教基础设施建设专项智能运管项目,国家自然科学基金青年科学基金项目,国家重点研发计划青年科学家项目。在SIGCOMM, ICML,SIGKDD,WWW,FSE,INFOCOM等国内外顶级会议及期刊发表论文50余篇,Google Scholar总引用6000+,多篇论文获得最佳论文奖及提名。
张圣林
南开大学 软件学院教授、副院长
南开大学软件学院教授、博士生导师、副院长,入选南开大学“青年学科带头人培养计划”。2017年于清华大学计算机系获博士学位,并获清华大学优秀博士学位论文奖。主要研究方向为智能运维(AIOps)。以第一作者或唯一通讯作者在CCF A类会议和期刊发表论文40余篇。主持国家自然科学基金项目2项,以及华为、字节跳动、阿里巴巴、腾讯等企业横向课题近30项。荣获CCF A类会议FSE 2026唯一杰出工业论文奖,并三次荣获CCF B类会议ISSRE最佳论文奖,创该会议35年历史上个人获奖次数之最。获中国电子学会科技进步一等奖(第3完成人)、天津市科技进步一等奖,以及华为计算产品线“最佳技术合作教授”、南开大学“良师益友”、麒麟软件“校企合作突出贡献奖”等荣誉。联合创办CCF AIOps挑战赛,并担任首届和第六届程序委员会主席;担任CCF 2026中国软件大会程序委员会主席、CCF 2025中国网络大会宣传委员会主席、CCF YOCSEF天津学术委员会副主席(2023—2024)、CCF互联网专委常务委员。
待定
待定
面向运维的智能体 OpsAgent & 面向智能体的运维 AgentOps
议题背景:
现代大规模 IT 系统运维面临故障频发、根因定位慢、人才短缺等难题,大模型 Agent 为智能运维带来新机遇,报告围绕**面向运维的智能体 OpsAgent**与**面向智能体的运维 AgentOps**两大方向,介绍 KRCA、OpsAgent 事件管理、GoS 溯因推理框架,以及 PROBE、AgentTether、TraJudger 系列产学研研究,阐述技术方案与企业落地效果,同时分析两类技术现存能力局限,展望运维智能体后续技术发展方向。

内容大纲:
1. 研究背景与现实挑战
1.1 现代运维痛点与产业国家需求
当前 IT 系统规模高速增长,百万级服务器、海量微服务带来故障处置压力,传统人工运维模式难以为继;智能运维已纳入国家相关规划与国家标准,但传统 AIOps 缺少认知推理能力,引出两大核心概念:OpsAgent 用 Agent 解决传统 IT 故障,AgentOps 针对非确定性 Agent 系统做 “运维的运维”,同时概述整体研究布局。
2. OpsAgent:面向运维的智能体
2.1 KRCA:超大规模微服务根因分析
针对超大规模微服务系统动态漂移、指标海量的问题,KRCA 采用 API 下钻、构建因果骨架、多智能体并行验证的三段式方案压缩搜索空间,解决传统 RCA 训练滞后、大模型上下文爆炸的缺陷,该方案已在生产环境部署,大幅缩短故障定位时长。
2.2 OpsAgent 多智能体事件管理
面向异构观测数据不统一、推理不可审计、静态能力无法迭代的落地难题,该系统将指标、日志、调用链转化为统一结构化证据底座,通过多智能体分工协作 + 交叉审查输出可审计报告,并结合 PPO、RAG 实现模型与知识的双路径自进化,轻量开源模型取得优于大参数量闭源模型的诊断效果。
2.3 GoS 通用溯因推理框架
针对 Agent 溯因推理中证据编造、上下文漂移、回溯失效等问题,GoS 采用认知层多智能体调查 + 符号层因果图与状态机导航的双向闭环架构,依靠状态机实现矛盾回溯与证据驱动下钻,框架具备跨域通用性,可同时支撑分布式故障、医疗诊断任务,兼顾推理精度与调用成本。
2.4 OpsAgent 能力边界与发展方向
OpsAgent 定位为人机协同的效率辅助工具而非完全自主运维,仍存在跨域复杂故障诊断不足、知识库更新滞后等局限;未来将围绕知识增强可信推理、多模态理解、大小模型协同推理开展技术探索。
3. AgentOps:面向智能体的运维
3.1 AgentOps 的挑战与闭环能力模型
Agent 系统具备非确定性、自主决策、故障难复现等特征,和传统确定性系统运维存在本质差异,面临预测难、复现难、干预风险高等多项挑战;构建 “观测‑诊断‑约束‑验证‑学习” 闭环能力,实现 Agent 系统的可观测、可解释、可恢复、可治理。
3.2 PROBE 与 AgentTether:Agent 故障恢复与运行时干预
PROBE 聚焦软件工程智能体,通过遥测采集、证据融合、门控校验生成带边界的结构化恢复指导;AgentTether 针对错误传播、修复指导衰减问题,基于轨迹图与图学习模型定位上游根因,配合运行时受控干预提升重试修复成功率,两项工作分别从事后诊断、运行时动态干预补齐 Agent 故障恢复能力。
3.3 TraJudger:多智能体系统故障诊断
多智能体系统故障会通过交互形成隐式传播链,传统评判方式只能发现表层症状;TraJudger 构建层次认知图融合静态约束与动态执行轨迹,划分故障源、故障传播步骤完成反向溯源,输出结构化诊断报告,在企业实测中显著提升根因与故障类型识别准确率。
3.4 AgentOps 能力边界与发展方向
AgentOps 现阶段在复杂概率故障定位、修复动作系统风险管控上仍存在短板;未来重点研究系统级协同治理、细粒度因果归因、自适应闭环进化,进一步降低人工依赖。
4. 总结与展望
4.1 整体总结与未来演进思路
OpsAgent 与 AgentOps 代表 AIOps 的重要演进,分别解决传统 IT 系统和 Agent 系统本身的运维问题,人机协同是现阶段的主流模式;未来运维智能体会向可信、全面、高效持续演进,逐步向更高程度自主运维迈进。
4.2 Q&A
现场问答交流。

听众收益:
1. 建立统一的技术认知框架:厘清OpsAgent(面向运维的智能体)与AgentOps(面向智能体的运维)的对象、挑战、核心能力和演进路线,理解二者为何需要协同建设。
2. 掌握可复用的诊断与恢复方法:结合FoundRoot、OScope、PROBE和TraJudger,学习结构化推理、SFT+RL、知识对齐、报告校验、神经-符号协同、证据链构建和Guidance Gate等关键设计与技术取舍。
3. 获得工程落地的判断依据:结合性能结果、企业部署成效及边界与局限,理解各方案在微服务、操作系统、软件工程Agent和多智能体系统中的适用条件,以及如何把诊断结论转化为约束下一轮执行的修复动作。
王俊杰
中国科学院软件研究所研究员  博士生导师
中国科学院软件研究所研究员,博士生导师,智能博弈重点实验室副主任(主持工作)。中国科学院特聘研究岗位,青年创新促进会会员。主要从事智能化软件工程、软件质量等方面的研究。在国际著名学术期刊/会议发表70余篇高水平学术论文,荣获ICSE、CHI、ICPC等会议的杰出论文奖、ACL领域主席亮点论文奖,共同指导学生获ACM学生研究竞赛全球总决赛冠军、中国科学院院长奖、中国科学院优秀博士学位论文等。主持和参与了多项国家自然科学基金项目、科技部重点研发计划、CCF-华为胡杨林基金等。担任CCF A类期刊TSE的Associate Editor,ICSE、FSE、ISSRE等的PC member,TOSEM、EMSE、AUSE等期刊的审稿人。
待定
待定
大模型智能体轨迹分析:从失效定位到驾驭工程
议题背景:
随着大模型智能体(LLM Agent)从原型走向实际应用,其行为动态生成、推理过程黑盒、系统级缺陷难以定位等问题成为质量保障的核心瓶颈。执行轨迹作为还原智能体思考过程、复现失效场景的关键媒介,正成为故障诊断、归因与修复的基础抓手。
本报告将基于团队撰写的综述文章《LLM Agent Trajectory Analysis: From Failure Attribution to Enhancement》(TSE 2026)对大模型智能体轨迹分析领域进行介绍,包括智能体失效的分类体系、失效定位技术、智能体自演化和能力提升技术、轨迹可视化技术、以及相关基准。也将介绍团队开展的研究工作,面向大模型智能体(LLM Agent)的系列工作,包括:失效定位基准TraceElephant,基于因果分析的失效定位方法CHIEF,基于轨迹分析的驾驭工程自动优化方法HarnessFix,利用版本变更经验增强Skill自演化方法VCE-Skill;以及面向工作流智能体(Agentic Workflow)的基准AgentFail和相关的演化提升技术FlowFixer等。

内容大纲:
1. 背景与研究动机:智能体质量保障的“三困”
1.1 软件范式的演进与 Agent 行为的不确定性
1.2 测试之困、定位之难、优化之惑——真实场景痛点
1.3 轨迹分析作为故障诊断与能力提升的基础媒介
2. 该领域主要研究工作全景
2.1 五大核心分析维度:故障分类学、失效归因、系统增强、监控工具、数据集基准
2.2 高频故障类型解析:指令保真度、任务规划、多主体协调
2.3 失效归因四大方法:模式分析、LLM推理、模型微调、动态运行时
2.4 当前性能瓶颈:步骤级归因准确率仅 25%–52%,Agent级显著优于步骤级
3. LLM Agent 失效定位与能力提升——我们的系列研究
3.1 失效定位基准:解决可观测性不全,构建高质量多智能体轨迹数据集
3.2 基于因果图的层次化归因:将扁平日志转为结构化因果图,通过分层Oracle引导回溯
3.3 智能体失效自动修复与Harness增强:轨迹结构化→根因定位→范围化修复→验证记忆,性能提升 5.9%–18.4%
3.4 Skill自进化增强:从版本变化中提炼演化经验,自适应融合当前轨迹,跨模型迁移性显著提升
4. Agentic Workflow 失效定位与能力提升——我们的系列研究
4.1 面向平台化工作流的缺陷经验研究:生命周期全链路分析
4.2 基于符号轨迹与符号推理的失败定位与修复:协同促进,面向长程/领域任务
5. 挑战与未来展望:迈向系统化 AgentOps
5.1 步骤级归因准确率仍待突破(30%–50%)
5.2 诊断信息需面向能力提升视角,覆盖约束满足、对齐、安全等多维评估
5.3 从 DevOps 到 AgentOps:构建可观测性标准、在线溯源归因、人类介入治理的一体化方案
刘兆洋
阿里巴巴 ATH事业群 高级算法专家
任职于阿里巴巴 ATH 事业群,主要负责AgentScope开源生态和模型Post-Training 相关工作,从事Harness Engineer、长期记忆、Agent评测和Agentic RL相关工作。过往工作履历包括淘宝首页推荐系统、支付宝红包运营、阿里云百炼Agent应用和Qwen模型训练相关工作。发表计算机顶会论文20余篇,Google引用2200+。
待定
待定
从 Chat 到 Cowork :生产力场景下的评测体系构建和模型优化
议题背景:
大模型正从 Chat 式问答走向 General Agent:它能在本地工作空间中调用搜索、计算机操作、编程、Skill、MCP 与记忆,与用户协作交付真实成果。Cowork 任务依赖大量文件、长程规划、多轮协同和专业判断,质量标准也从“回答是否合理”升级为“事情是否做成”。GDPval、Agents’ Last Exam 等评测已转向高价值工作,但模型在垂直知识、复杂流程规划和稳定交付上仍有短板。如何构建可复现、可解释且能指导优化的评测体系,成为通用智能体走向生产力场景的关键。

内容大纲:
1. 从 Chat 到 Cowork:通用智能体成为生产力基础设施
1.1 能力演进:从对话、推理和工具调用,走向端到端任务交付。
1.2 系统架构:模型与 Harness 协同管理 workspace、搜索、Computer Use、Coding、Skills、MCP 和 Memory。
1.3 任务特征:多文件、长链路、人机协同,以及面向专业产物的开放式验收。
2. 从“答得对”到“做得好”:Agent 评测的基本方法
2.1 评测难点:环境可复现、过程可观测、结果可验证,主观质量标准可校准。
2.2 OpenJudge 实践:围绕最终回答、工具选择与调用、过程轨迹和任务结果,构建多层 Grader。
2.3 工程取舍:组合规则/程序判分、LLM-as-a-Judge 与人工复核,并通过 Rubric 原子化、证据链和一致性校准提高可信度。
3. 面向 General Agent 的新评测范式
3.1 评测对象升级:从模型输出扩展到“模型 × Harness × 环境 × 用户协同”的端到端系统能力。
3.2 产物验收:针对文档、幻灯片、表格、代码等交付物,联合评估正确性、完整性、可用性和专业质量。
3.3 PawBench 实践:在隔离环境中挂载 workspace,组合自动 Grader 与 LLM Judge,比较不同模型和 Harness 的贡献。
3.4 前沿 Benchmark 启示:结合 GDPval、Agents’ Last Exam、Claw-Eval,分析垂直知识、复杂规划、跨工具协同与稳定交付的能力缺口。
4. 评测驱动模型优化:从人工经验到 Auto Research
4.1 人工优化闭环:失败分类 → 根因定位 → Prompt/Context/Harness 改进 → 回归验证。
4.2 评测即高质量 IO 环境:将任务、轨迹、产物和分数转化为数据、反馈与奖励信号。
4.3 自动优化:用 Benchmark 支撑数据构造、训练实验、策略搜索和自动回归,让评测成为 Auto Research 的基础设施。

听众收益:
1.形成系统认知:完整理解大模型从 Chat 到 General Agent 的能力演进、系统架构、任务形态,以及评测范式为何随之变化。
2.掌握落地方法:学会从任务与环境设计出发,对 Agent 的结果、轨迹、工具调用和工作产物建立多层 Grader,并组合自动评测、LLM Judge 与人工复核。
3.打通优化闭环:利用失败分类、回归集和评测 IO 推动 Prompt、Context、Harness 与模型训练优化,并进一步衔接 Auto Research。
李博杰
AI Agent 独立研究者
AI Agent独立研究者,曾任Pine AI首席科学家、华为首批“天才少年”,中国科学技术大学与微软亚洲研究院联合培养博士。在 SIGCOMM、SOSP、PLDI 等会议上发表多篇论文,曾获 ACM 中国优秀博士学位论文奖、微软学者奖。
待定
待定
Agent 持续进化:根据线上 bad case 自动更新 Harness 和模型参数
议题背景:
《深入理解 AI Agent》是我写的一本开源书,发布两周 GitHub star 超过 3 万,本次分享取自其中的第六至八章。
今天的 Agent 能零样本解决从未见过的复杂任务,却可能在处理了一万次相似任务之后,第二天仍然犯第一天的错误。让它越用越强,第一步不是训练,而是评估:系统若不知道任务有没有真的办成、是从哪一步开始错的,模型生成的反思就只是猜测;错误的结论一旦进入长期记忆或训练数据,还会跨任务不断放大。所以要先给 bad case 做失败归因、定位首个错误,再把修复目标固化成回归任务集。

有了可信的评估信号,下一个问题是:如何自动提取经验,又该写到哪里? 我们的做法是先判断它最自然的载体:能语言化的判断原则写进 Prompt,需要按场景加载的领域流程写成 Skill,可确定执行的约束写成 Harness 代码,高维感知、语言风格和隐式策略应写进模型参数。然后让每一次改动都可归因、可验证、可回滚。

内容大纲:
1. 背景:Agent 的能力悖论
1.1 处理了一万次相似任务,第二天仍犯第一天的错
1.2 保存经历 ≠ 从经历中学习
1.3 本次分享的主线:一个生产 bad case,如何走完"评估 → 参数化学习 / Harness 与 Skill"
2. 评估:一切的起点
2.1 Pass@k 看能力上限,Pass^k 看业务可靠性
2.2 bad case 的三类来源:用户纠正、点踩、事后审计
2.3 失败归因:定位轨迹中的首个错误,而不是最后一个报错
2.4 从归因到回归任务集:端到端回归任务 + 轨迹前缀回归任务——这就是第七、八章共同的输入
2.5 LLM-as-a-Judge 的前提:金标集校准与多源异构评判
3. 参数化学习:把能力写进模型参数
3.1 决策顺序:先问需不需要训,再 SFT,最后 RL
3.2 "SFT 记忆、RL 泛化"的量化边界与适用条件
3.3 数据和环境比算法更重要
3.4 主线落地:三个 bad case 走到参数更新——过早结束 → DPO;弯引号 → 作用域敏感 SFT;old_string mismatch → 精确复制 SFT
3.5 踩坑合集:边界集与保留集缺一不可、环境 token 未 mask、指标撞上 tokenizer 天花板
3.6 样本效率才是主要瓶颈:On-Policy Distillation
4. Harness 与 Skill:把经验写进模型之外
4.1 路由依据:这项能力能否被外部符号充分表达
4.2 四种载体:知识库、Prompt 与 Skill、程序与 Harness、模型参数
4.3 主线落地:同一批 bad case 的另一条走法——过早转人工 → Prompt 最小补丁;不可重试错误反复调用 → 重试熔断程序;高风险操作 → 确认门禁
4.4 Skill 与 Harness 的边界:Skill 主动规划沟通,Harness 在判断失误时兜底
4.5 把经验编译成程序:浏览器工作流 8.5–13 倍加速,但必须有独立回放验证
5. 模型与 Harness 的共同演进
5.1 两朵乌云:实时流式交互,与从交互中持续积累经验
5.2 模型会吃掉 Harness 吗:会,但一层一层吃,没有吃完的那一天

听众收益:
1. 从生产 bad case 出发:三类信号采集 → 失败归因定位首个错误 → 构造端到端与轨迹前缀两层回归任务 → 判断该改参数还是改 Harness/Skill
2. 一批已经用真金白银踩出来的坑与量化标尺,帮你在立项前判断"这事值不值得训模型"。
3. 一条"什么该训模型、什么该写进 Harness"的实用分界线,以及它未来会怎么移动。

胡永昌
华为核心网  运维智能体技术专家
西北工业大学本科/硕士,荷兰代尔夫特理工大学智能信息处理方向博士,现华为技术有限公司云核心网产品线网络高稳智能体技术专家,曾主导多个云核心网领域智能运维/网络自动驾驶项目课题,开发设计网络运维高稳智能体方案,以及相关AI大模型算法。精通AI算法理论的同时,深度理解云核心网业务和痛点,并解决问题和场景应用,保障产品落地。
待定
待定
高确定性自进化垂域智能体构建:核心网运维高稳场景实践
议题背景:
在通信网络中,核心网地位极其重要,出现问题影响极大。对于网络高稳/智能运维诉求极高,需要推理结果保证高确定性和可解释性,以及面向未知场景,具备持续学习的要求。然而,传统智能体强依赖大语言模型推理,天然存在幻觉、且反复增训难度成本较高。
本议题分享华为核心网运维高稳场景实践,构建垂域图智能体,实现确定性、可解释性的故障诊断推理,配合Skill实现持续学习自主优化。

内容大纲:
1. 核心网背景介绍、故障运维特点对比分析:
1.1 ADN行业背景:华为核心网为全球最大份额,ADN自动驾驶网络是通信行业的统一共识和目标;
1.2 核心网运维特点:核心网地位较高、故障影响大、故障模式高阶低频、交付式运维(而非传统自运维)等。
2. 网络高稳/智能运维能力诉求: 智能体推理结果高确定、推理时长可控,推理过程可解释、智能体自进化
3. 图智能体方案:以外置图为推理主体,构建快慢自适应推理机制,实现推理结果高确定、推理时长可控,推理过程可解释。
3.1 电信自进化异构知识图谱:图谱新范式融合业务机理、推理逻辑、任务规划,且可以持续更新知识,提供领域领域知识/业务上下文,让智能体“懂业务”。
3.2 确定性推理 & 探索式推理 双轮驱动的智能体架构:
3.2.1 确定性“快“推理:基于知识图谱,确定性推理引擎,采样推理路径,准确率100%,推理时长<1min,实现推理结果高确定、过程可解释、推理时长可控。
3.2.2 探索式“慢“推理:基于诊断推理Skill,Agentic Loop探索式推理执行,调用8大运维数据专业分析模型(KPI、告警、日志、信令、话单、数传、操作、拓扑)“看数据”,电信自进化异构知识图谱“补知识” ,实现诊断能力跨场景泛化,并持续反思学习历史数据,固化成功经验后,转确定性推理,保障准确性。
3.3 自动化知识反思学习:构建领域知识增强的GEPA算法,反思总结历史经验(上下文、推理轨迹、成功/失败结果),优化更新知识图谱。
3.4 核心网故障诊断推理实践分享。
4. 智能体自进化方案:
4.1 自进化智能体定义 & 历史背景 & 智能体自进化架构 & 7个自进化对象 & 四个技术路线 & 业界发展趋势预测
4.2 Skill自进化方案:Skill发展历史、Skill自进化解决的问题、Skill自进化的目标
4.3 Skill自进化整体方案 & 关键技术:Skill创建,Skill使用、Skill评估、Skill自进化。
4.4 核心网故障诊断Skill自进化实践分享。
5. 汇报总结

听众收益:
1. 如何构建具备高确定性、可解释性推理能力的智能体。
2. 如何持续学习、积累沉淀知识?
3. 如何构建具备自主进化能力的智能体?
 
关注QECon公众号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
135-2067-8913  媛媛
媒体合作
135-1619-6409  皮皮
添加QECon小助手,获取
会议最新资讯
购票咨询
13520678913  媛媛
服务总线
400-183-9980  
电话咨询
联系电话:
翟国娟 15901265561