专场:可观测性驱动 Agent 质量演进与架构优化
在企业级 Agent 从 Demo 走向规模化生产的过程中,可观测性绝不应止步于“事故后的看图排障”。传统的 APM 指标无法评估智能体的决策优劣,而零散日志也难以解释“系统返回 200,但用户任务彻底失败”的假健康状态。如何精准定位异常?如何量化 Agent 过程质量?如何确保 Prompt、Tool 或模型升级后系统不发生隐形降级?  本专场聚焦 Agent 可观测性与质量闭环体系建设。我们将深入探讨如何打通 “全链路观测 ➔ 跨层因果归因(RCA) ➔ 失败样本回流 ➔ LLMs-as-a-Judge 过程评估 ➔ 自动化发布门禁” 的完整质量飞轮。  专场将包含一线落地实战经验:从基于 LLMs-as-a-Judge 的过程与结果双重评估(Rubrics 机制),到跨层因果链下的异常根因定位;从 Tool/MCP 循环与记忆截断的精准拦截,到线上 Trace 转化为离线回归测试集(Trace-to-Dataset)。我们旨在为 complex Agent 构建可复盘、可评估、可演进的质量底座,保障企业 Agent 规模化运行的稳定性与持续进化。
专场出品人:黄闻欣
腾讯 技术总监
自 2009 年加入腾讯以来,曾管理系统测试团队,技术垂直领域的性能专项团队和可观测 RUM / AI 工作台的业务团队,深耕技术管理和团队效能提升领域。作为大模型技术的深度实践者,通过将其融入日常管理流程,在团队协作、知识管理、绩效评估等关键场景取得显著成效。目前负责IaaS、数据库、元宝的性能工程工作和AI评估工作,探索将AI团队共脑与 AI 决策相结合的管理新模式,致力于用 AI 技术重塑传统管理模式,构建高效的团队价值传递体系。
王勇
58同城 高级研发工程师
58 同城高级研发工程师,深耕一线研发与效能领域多年,拥有多项 AI 技术发明专利。目前主要负责 AI 测试专项,主导通用测试 Agent 研发与落地,从零搭建包含智能用例生成、测试知识库、知识图谱、多 Agent 编排与观测能力的通用测试效能平台,长期聚焦 AI 赋能软件测试方向,持续推进测试智能化与研发效能提升。
待定
待定
从链路可观测到质量可信:通用测试 Agent 工程化实践
议题背景:       
随着大模型与 Agent 技术在测试领域落地,测试 Agent 正在从“辅助问答、用例生成”走向“真实执行、结果校验、报告输出”。在通用测试场景中,一个需求往往同时涉及 Web、App、API 等多端链路,单一 Agent 很难同时完成需求理解、能力路由、任务执行、证据采集和结果汇总,因此多 Agent 编排逐渐成为通用测试 Agent 的主流工程形态。
但多 Agent 带来能力增强的同时,也放大了系统的不确定性。LLM 本身是概率性模型,而质量测试要求的是确定性结果:路由是否准确、需求是否被正确切分、Agent 是否被正确调度、执行失败发生在哪一层、报告结论是否有证据支撑,都会直接影响测试结果的可信度。只看到最终报告,已经无法满足通用测试 Agent 的工程化治理要求。
本议题结合 QAClaw 助手端与 QAFlow 编排中枢的实践,分享我们如何在通用测试 Agent 中构建链路可观测能力:通过 Trace、Ledger、Artifact、Timeline 等机制,将一次测试任务从用户输入、Agent 路由、需求切分、调度执行、证据采集到报告输出的全过程结构化记录下来,并以 API Agent 漏派等真实问题场景为例,说明如何通过链路可观测完成问题定位、策略修复、回归验证和质量治理闭环。

内容大纲:
1. 背景与挑战:通用测试 Agent 走向可信执行的必经之路
1.1 传统测试 Agent 的“信任危机”
1.1.1 能跑不等于可信:最终报告无法解释过程
1.1.2 概率性模型在质量场景中的不确定性
1.2 多 Agent 编排带来的能力增强与控制面放大
1.2.1 Web、App、API 专业 Agent 提升测试覆盖能力
1.2.2 路由、切分、调度、报告聚合引入新的失控风险
1.3 我们的解法:从单点执行走向“编排 + 可观测”的工程体系
1.3.1 QAClaw + QAFlow 承载通用测试 Agent 的编排链路
1.3.2 链路可观测作为通用测试 Agent 的可信控制面
2. 核心架构:QAClaw + QAFlow 通用测试 Agent 编排中枢
2.1 QAClaw 助手端:用户入口与过程可视化
2.1.1 负责需求提交、任务触发与测试运行查看
2.1.2 通过 Timeline 折叠复杂编排状态
2.2 QAFlow 编排中枢:决策、调度与汇总
2.2.1 负责 Agent 路由、需求切分、调度执行和报告聚合
2.2.2 管理 Web/App/API Agent 之间的信息流与数据流
2.3 专业 Agent 分工:面向不同测试场景的能力拆解
2.3.1 Web Agent:页面流程执行与结果校验
2.3.2 App Agent:移动端需求回归与巡检
2.3.3 API Agent:接口链路分析与契约校验
2.4 工程契约:让编排过程可追踪、可复盘
2.4.1 InvocationEnvelope 与 AgentResult 统一输入输出
2.4.2 Test Run Ledger 沉淀请求、任务、尝试、结果和反馈
2.4.3 Artifact 证据索引支撑报告可信
3. 落地实践:从 API Agent 漏派到质量治理闭环
3.1 攻克信任:让 Agent 行为从黑盒变成可解释链路
3.1.1 问题现场:混合需求中 API Agent 被漏派
3.1.2 链路还原:从原始需求、路由决策到调度执行逐层下钻
3.2 挑战复杂:跨 Agent、跨系统、跨链路的任务追踪
3.2.1 判断问题发生在路由、调度、执行还是报告聚合
3.2.2 用 Trace、Ledger、Artifact 串起完整执行事实
3.3 提升质量:从单次排障走向策略修复
3.3.1 Prompt 修正:让 LLM 理解混合测试需求
3.3.2 规则补全:显式 API 信号触发确定性兜底
3.3.3 协议校验:确保 AgentResult 与报告聚合一致
3.4 治理闭环:让失败 Trace 成为质量资产
3.4.1 对象建模:围绕 Test Run Trace 定义链路事实
3.4.2 采集标准化:在关键控制点保留可复查证据
3.4.3 回归验证:失败 Trace 转成 Eval 样本
3.4.4 治理指标:漏派率、证据覆盖率、报告可信度
4. 总结展望:从问题可见到质量可信
4.1 实践收益:问题可见、根因可查、修复可验证
4.2 工程价值:多 Agent 编排是场景,可观测是控制面
4.3 未来展望:通用测试 Agent 的可信工程化演进

听众收益:
1. 理解通用测试 Agent 从“能跑”走向“可信”的关键矛盾:在 LLM 概率性、任务多样性和质量确定性要求之间,如何通过工程化约束提升 Agent 测试结果的可信度。
2. 掌握多 Agent 测试编排的通用设计思路:如何拆分用户入口、编排中枢、专业执行 Agent、统一协议、执行账本和证据体系,避免多 Agent 协作停留在简单能力堆叠。
3. 获得一套链路可观测驱动的 Agent 质量治理方法:通过 Trace 还原执行链路,通过结构化数据沉淀关键事实,通过证据索引支撑报告可信,通过 Eval/回归样本推动持续优化。
汪璐璐
腾讯音乐 高级专项测试工程师
工作7年,东南大学硕士,毕业后入职 TME,主要负责音视频算法、AI-Agent类测试开发工作。
目前在腾讯音乐负责算法效果类专项测试及主客观评估工具开发落地,包括音视频专项质量保障、AIGC 生成内容、AI-agen内容质量保障以及客观评测模型研发落地。研究方向包括算法效果类评测、主客观评价、评价标准&工具。
待定
待定
从E2E到节点级:构建音乐 AI Agent 全链路可观测的质量保障体系
议题背景:
随着LLM在音乐场景的落地,传统QA手段面临失效:音乐Agent具有“黑盒推理+长链路调用”特性,单纯依赖端到端(E2E)测试往往只能判定“结果错”,却无法定位是意图理解偏差、工具调用失败还是知识库缺陷;同时,音乐审美的主观性导致评测标准难以量化,人工标注成本高且一致性差。本次分享将重点探讨如何构建“端到端结果校验+全链路过程监控”的双轨评测体系,通过链路Trace与节点级埋点,在守住最终用户体验底线的同时,将不可控的黑盒转化为可视化的白盒,实现从“知其错”到“知其所以错”的质变。

内容大纲:
1. 音乐AI Agent的评测困境与挑战
1.1 长链路黑盒化:单纯E2E测试只能看到表象结果,定位不到原因
1.2 主观与客观的博弈:如何定义agent效果好,缺少量化指标
2. 双轨评测体系的架构设计与演进
2.1 从单点到分层:构建“端到端兜底+过程链路拆解”的评测矩阵
2.2 评测平台整体架构:用例管理、调度引擎与数据采集层
3. 过程监控体系的搭建与节点级量化(★核心亮点)
3.1 链路拆解与埋点设计:意图识别准确率、工具调用参数合规性、知识检索召回率的指标定义
3.2 Trace全链路追踪:构建串联多模态日志,实现失败路径自动归因
3.3 工程落地坑点
4. LLM-as-Judge 多Agent协同评估实践
4.1 评估Prompt工程:如何构建抗干扰、可复现的评判标准?
4.2 多模型交叉验证与人工标注对齐策略,降低幻觉评分
5. 跨端异构环境的自动化采集与归一化(★升级重点)
抽象底层驱动层,无缝切换iOS/Android/HarmonyOS三大生态的方案
6. 落地收益与总结展望
6.1 量化收益:评测效率提升300%,缺陷定位准确率提升至90%+
6.2 质量改进:从“感性吐槽”到“数据驱动”的产品迭代闭环

听众收益:
1.掌握“E2E+链路”双轨评测方法论:学习如何在保证端到端结果正确的前提下,通过过程监控实现精准归因,解决黑盒Agent的根因定位难题。
2.获取跨端自动化采集的通用方案:了解如何在iOS、Android、鸿蒙等多系统间构建统一的采集与适配层,规避碎片化环境下的重复开发成本。
3.获得LLM自动化评估实战经验:获取Prompt设计、多模型交叉验证及评分校准的一手经验,规避人工评估一致性差的陷阱。

蔡丽珊(溪禾)
蚂蚁集团  高级测试开发工程师
多年从事 AI 质量技术、Agent 工程化、搜索推荐评测和业务质量保障工作。负责 AI 策略生成链路的 Evaluator 评测框架与可观测体系建设,完善产物校验、评估反馈、链路追踪能力;负责支付宝酒旅行业智能体评测,建设评测集、指标体系及归因机制;负责出行搜索推荐的离线评测、线上实时评测、特征及模型质量建设,以评测驱动算法优化和业务效果提升。同时具备酒店、文旅、机票、铁路等行业质量保障经验。
擅长领域:可观测性、智能体评测、搜索推荐、大模型及质量工程。
待定
待定
让 Agent 产出可验证、问题可定位:Evaluator 与全链路可观测实践
议题背景:
AI 策略生成已从单轮问答演进为 SuperAgent 编排多个 SubAgent、Tool 和 LLM 的长程任务,过程中持续产出多阶段 Artifact。传统接口测试只能判断流程是否结束,既难验证产物的结构、语义与跨阶段一致性,也难定位失败发生在模型、工具还是编排环节。本议题基于真实策略生成链路,分别介绍以 Artifact 为中心的 Evaluator 框架和以 Trace/Span 为中心的执行可观测体系,重点分享规则与模型的分工、证据与反馈闭环,以及异步并发下的链路归因和工程踩坑。

内容大纲:
1. 背景介绍—Agent 跑完了,产出就真的可用吗?
1.1 长程 Agent 的多阶段 Artifact 质量问题
1.2 SuperAgent、SubAgent、Tool 和 LLM 黑盒链路的定位难题
2. 让产出可验证—以 Artifact 为中心的 Evaluator 框架
2.1 Artifact 驱动的评测触发与路由机制
2.2 硬约束规则与软约束 Evaluator Agent 的分层协同
2.3 独立 Evaluator SubAgent 的上下文隔离与证据边界
2.4 从检查项执行、结构化报告到 SuperAgent 反馈的评测闭环
3. 让问题可定位—以 Trace/Span 串起 Agent 执行链路
3.1 SuperAgent、SubAgent、Skill、Tool、MCP 和 LLM 全链路采集
3.2 基于远程流式响应的 SubAgent 内部 Span 反向构建
3.3 异步、并行、重试和多机执行下的 Trace 上下文治理
3.4 流式输出、历史日志、评测报告与 Trace 的关联展示
4. 三个可复用的工程踩坑—评测和可观测为什么也会不可信?
4.1 Evaluator 不是事实源—用证据契约约束无依据的模型判断
4.2 Trace 上下文不等于线程上下文—避免异步并发下的串链与丢链
4.3 可观测数据也需要一致性设计—处理远程协议、双数据源合并与 Token 口径
5. 实践结果—从发现问题走向驱动 Agent 优化
5.1 形成覆盖策略生成关键环节的多类 Evaluator、数十项硬约束检查和十余项软约束 Skill
5.2 在十余个真实任务、数百次评测执行及数百条策略上验证评测与问题归因能力
5.3 通过规则、文件、策略和执行 Span 归因,反哺 Prompt、Skill 与编排优化

听众收益:
1. 掌握一套以 Artifact 为中心的 Agent Evaluator 设计方法,能够根据确定性、语义性和证据边界拆分硬约束、软约束及外部系统校验。
2. 理解 SuperAgent、SubAgent、Tool 和 LLM 全链路可观测的关键实现,获得处理异步并发、远程链路反向构建、实时与历史数据融合的工程经验。

徐为
黄梓航
 亚马逊云科技 
资深解决
方案架构师
 亚马逊云科技 
资深 AI 产品解决
方案架构师
徐为:
亚马逊云科技资深解决方案架构师。硕士毕业于 Erasmus Mundus IMMIT 经济与 IT 管理专业。自 2006 年起,先后以研发工程师、数据工程师、解决方案架构师身份在 SonyEricsson、SAP SE、Alibaba Cloud、Tencent Cloud 等多家跨国企业从事 IT 相关工作超过 15 年,积累了丰富的跨行业技术实践经验。目前专注于帮助客户在云上构建优雅的解决方案,核心技术方向包括微服务架构、可观测性、AIOps 与 AgentOps。致力于将前沿学术成果与工程实践相结合,推动企业级 AI Agent 系统从 POC 走向可靠的生产落地。

黄梓航:
......
待定
待定
非确定性系统的新一代质量工程:
Gödel 飞轮 —— 让 Agent 拥有可测量、可回归、可持续进化的质量
议题背景:
89% 的 AI Agent 项目在上线后表现急剧下滑——但这不是"模型问题",而是质量工程范式的空缺:传统 QE 的确定性断言、覆盖率、回归测试面对非确定性、多步骤、带工具调用的 Agent 时集体失效。QA 团队被推到最前线,却没有拿到新的工具箱。
本 session 从 QE 的视角提出 Gödel Agentic Flywheel——一套把 AgentOps 重构为质量工程闭环的方法论:Observe(可测量) → Evaluate(可断言) → Optimize(可回归) → Govern(可审计),并让整个飞轮拥有哥德尔递归性——它不只是测 Agent,它也在测自己("谁来评估评估者")。
我们把每个环节都落到 QE 团队熟悉的概念:Eval-as-Test 取代单元断言、Golden Set + LLM-as-Judge 取代人工回归、Trace-as-Coverage 取代代码覆盖、Prompt/Model Change → CI 门槛 → 灰度 → 回滚 取代版本发布。理论支柱涵盖 Compound AI Systems、Antifragility、Cybernetic Feedback Loop 与 Evolutionary Architecture,并引用 2026 年最新学术成果:SARSI 递归自改进、MetaSkill-Evolve 双时间尺度演进、AgentOps Automation Pipeline 等 7 篇论文。
工具层由 Amazon Bedrock AgentCore Evaluations / Observability / Optimization 与 Amazon CloudWatch Omni for Agents 承担——把"人评 + 表格"升级成 managed evaluators、A/B experiments 与从本地到生产的一条 trace。
方案已在多个行业头部客户中落地,覆盖智能硬件、家电、生命科学、金融等场景——AgentCore Evaluation & Observability 项目、多租户 Agent 平台合规化 QE、以及金融高风险场景的四象限方案。Live Demo 演示:一次 Prompt 修改 → 自动跑回归评测 → 出质量报告 → 走 CI 门槛 → 灰度 → 回滚。你会拿到 QE 团队进入 Agent 时代的 Level 1 → Level 4 成熟度路线图 和一份可直接套用的 Eval Suite 模板。

内容大纲:
1. 传统 QE 为什么在 Agent 时代集体失效
1.1 断言、覆盖率、回归三件套的失效方式
1.2 Flaky test 从"少数例外"变成"系统本质"
1.3 三个真实事故:一次 Prompt 改动引发的线上劣化
1.4 QA 团队被推到最前线,但工具箱没有升级
2. QE for Agents:核心概念重定义
2.1 Eval-as-Test:从单元断言到评分函数(scoring rubric)
2.2 Golden Set + LLM-as-Judge:新一代回归基线
2.3 Trace-as-Coverage:用 reasoning chain 替代分支覆盖
2.4 Non-determinism budget:把"允许多少不一致"作为一等质量属性
3. Gödel Agentic Flywheel:QE 视角
3.1 Observe(可测量)— 五类 QE 必采信号
3.2 Evaluate(可断言)— LLM-as-judge、rubric、human-in-the-loop 的取舍
3.3 Optimize(可回归)— Prompt / Tool / Memory 变更后的自动回归
3.4 Govern(可审计)— 每一次决策都能回放的证据链
3.5 哥德尔递归:"评估评估者"——Meta-eval 的必要性
4. Eval Suite 设计:从零搭一套 Agent 质量基线
4.1 数据集:Golden Set / Adversarial Set / Drift Set 的比例
4.2 指标:Correctness / Faithfulness / Safety / Cost / Latency 五轴
4.3 打分方式:Rule-based vs. LLM-Judge vs. Human 的组合
4.4 覆盖度指标:如何量化"我测到了没有"
4.5 Eval 集自己的漂移检测
5. 把飞轮接进 CI/CD:质量门槛与发布节奏
5.1 Prompt / Model / Tool 变更的三级门槛
5.2 Trace diff:给 reviewer 一份"这次修改到底改变了什么"的可视化
5.3 灰度 + 自动回滚触发条件
5.4 事后 postmortem 自动生成与追责
6. AWS 工具支撑
6.1 AgentCore Evaluations & Observability:从本地开发就能跑回归
6.2 CloudWatch Omni for Agents:IDE-first 的 QE 视图
6.3 Managed Evaluators 与 A/B Experiment 的 QE 用法
6.4 一份 trace 在开发 / 评测 / 生产 / 审计四个场景的复用
7. QE 成熟度 Level 1 → Level 4
7.1 Level 1 手工飞轮:人评 + 静态基线
7.2 Level 2 半自动:eval 集自动化、告警驱动回归
7.3 Level 3 自动优化:CI 门槛、灰度、自动回滚
7.4 Level 4 Gödel 飞轮:飞轮自我评估、eval 集自演进
7.5 QA 团队组织重塑:从"测试执行者"到"质量策展人"
8. 大客户实证
8.1 智能硬件与家电行业多家头部客户 —— AgentCore Evaluation & Observability 项目里的 QE 团队角色
8.2 生命科学行业头部客户 —— 多租户 Agent 平台的合规化 QE
8.3 金融行业头部客户 —— 高风险场景下的 QE 门禁设计
9. Live Demo:一次 Prompt 修改,走完整个飞轮
9.1 本地修改 → 触发自动回归 → 质量报告
9.2 走 CI 门槛 → 灰度 5%
9.3 CloudWatch 检测漂移 → 自动回滚
9.4 事后 postmortem 自动落地到 Eval 集,形成飞轮下一圈
10. Takeaway 与下一步
10.1 QE 团队进入 Agent 时代的 Level 1 → Level 4 成熟度路线图
10.2 可直接套用的 Eval Suite 模板(下载)
10.3 常见反模式:把 Agent 当传统软件测的五个坑
10.4 Q&A

听众收益:
1. 拿到一份可直接套用的 Agent Eval Suite 模板(Golden Set / Adversarial Set / Drift Set 三层)
2. 理解如何将 Eval-as-Test / Trace-as-Coverage 接入既有 CI/CD 流水线
3. 具备与 AI 团队协作时"该测什么、怎么算通过"的共同语言
4. 看清 QE 团队从"测试执行者"到"质量策展人"的转型路径
5. Positioning 与差异化(对内说明)
6. 面向 QA/QE,切入点是"传统 QE 在 Agent 时代失效",不讲模型也不讲 agent 框架
7. 术语全部换到 QE 团队熟悉的层级:断言、覆盖率、回归、门槛、灰度、回滚
8. Live Demo 的主线不是"演一个 Agent",而是"演一次 Prompt 修改如何走完质量流水线"
9. 与 Agentic Conference 版本相比:相同的飞轮,不同的听众语言与 demo 主线
敬请期待
......
.....
待定
待定
敬请期待
....
关注QECon公众号
关注QECon视频号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
159-0126-5561 小娟 
媒体合作
135-1619-6409  皮皮
购票咨询
小娟 15901265561
服务总线
400-183-9980  
电话咨询
联系电话:
翟国娟 15901265561