专场:评测驱动AI研发:构建持续进化的反馈飞轮 
本专场聚焦模型与智能体的评测体系搭建与实际研发落地。研发优化迭代依赖量化依据,缺少标准化度量,模型与Agent的升级优化便无明确抓手。当前多数评测方式指标不成体系、贴合业务场景不足,难以有效指导AI编码、人机协作、智能体任务执行等研发工作。本场将围绕实操落地,分享LLM与智能体评测体系的搭建方法,梳理AI编码效率、人机协作效能等核心评估指标,介绍评测基准的设计逻辑、实操流程及行业对标手段,帮助团队建立常态化评测机制,依托量化数据推进模型与Agent的常态化迭代优化。
专场出品人:付宇 
支付宝技术部 行业质量与评测技术负责人
毕业于上海交大,在DFKI GmbH从事NLP相关工作。曾担任过余额宝、乘车码、健康码等多个国民级应用的质量保障1号位。现专注于政务民生、出行酒旅、就业与物流等行业的技术风险保障,致力于行业AI助手评测技术体系的创新攻坚,助力算法敏捷迭代与效果提升。
顾汉杰
阿里云 云原生高级技术专家
拥有12年软件研发与技术架构经验,长期深耕日志、可观测与大数据领域,近年聚焦AI应用可观测与质量工程方向。目前负责AgentLoop——一站式AI应用可观测与质量评估平台的产品设计与落地,打通从运行时
数据采集(Trace/日志)、数据集与Pipeline处理、Agent能力评估与实验、到记忆与RL训练信号的完整闭环。他主导了AgentLoop在电商智能客服Agent场景的首个生产级落地,构建了覆盖研发态预跑评测与运行时在线质检的全链路质量管控体系,将机审覆盖
率从不足5%提升至95%+、人工标注成本降低60%+。擅长将一线生产实践提炼为可复用的工程方法论。
待定
待定
AgentLoop:运行时数据驱动的全链路 Agent 质量闭环与
自进化飞轮——电商智能客服落地实践 
议题背景:
当Agent从Demo走向生产,质量便从“能不能跑通”变成了“每天数十万通真实对话里有多少在悄悄出错”:传统抽样质检覆盖率不足5%、离线测试集又脱离线上真实分布,问题往往在用户投诉之后才被发现。AgentLoop的答案是回到数据——以Agent运行时数据为地基,把采集、处理、评估、实验、审计、经验反哺串成一条端到端闭环,让质量从“发布前的一道关卡”变成“贯穿生产全程、并驱动Agent自我进化的数据飞轮”。本议题将以电商智能客服这一真实生产场景为案例,完整拆解这条闭环的每一环与背后的取舍。

内容大纲:
1. 背景:当Agent冲进生产,质量掉进“黑盒”
1.1 电商智能客服走向“AIAgent+人工”混合模式:质量难量化、难监控、无统一标准
1.2 传统抽样质检覆盖率不足5%,95%+的对话进入“质量黑盒”
1.3 AgentLoop的解法:以运行时数据为地基,串起采集→处理→评估→实验→审计→经验反哺的全链路质量闭环
2. 地基:Agent运行时数据的采集与处理
2.1 主打运行时数据:全量采集多轮对话、工具调用、检索、模型输入输出、Token与耗时的Trace(框架无关接入)
2.2 从原始Trace到可用数据:结构化、会话级轨迹组装、脱敏与海量span治理
2.3 线上Trace自动转Dataset:让真实生产数据直接成为评估素材
2.4 踩坑:50KB大字段处理、跨账号只读授权、海量日志查询分片
3. 度量:评测驱动,从抽检到全检
3.1 评估范式转变:从“单次回复好不好”到“多步任务成没成”
3.2 评估器体系:Agent-as-a-Judge+rubric,内置幻觉、正确性、工具合理性、置信度等评估器
3.3 过程指标+结果指标双层体系,机审覆盖率5%→95%+
3.4 分析洞察:评分分布/趋势+聚类归因,异常区域自动定位
3.5 踩坑:评估器一致性、幻觉抑制、成本控制、“评估器自身也要被评估”
4. 验证与守线:实验+审计
4.1 实验:prompt/模型/策略A/B对比,用评估分数验证改进,支持灰度门禁与回滚
4.2 审计:隐私/交易资损/营销合规红线的一票否决门禁
5. 反哺:上下文工程与经验库,让Agent越用越聪明
5.1 从Agent轨迹中提炼可复用经验:成功轨迹沉淀经验、失败轨迹沉淀规避
5.2 记忆库+经验库反哺下一次运行,闭合数据飞轮
5.3 从评估到信号:把评估结果转化为可验证的RL训练信号
6. 闭环成效与复盘
6.1 量化收益:机审覆盖率5%→95%+、人工标注成本↓60%+、处理准确率96%+
6.2 沉淀:可复用的电商智能客服评估能力包与全链路工程范式
6.3 反思:哪些交给Agent、哪些留给人;平台化vs通用评估框架的取舍

听众收益:
1.一套可复制的生产级Agent质量闭环方法论:以运行时数据为核心,串起采集、处理、评估、实验、审计、经验反哺的端到端链路,而非零散测试技巧,拿回去就能对照落地。
2.全链路工程落地细节与真实踩坑:海量Trace治理与会话级轨迹组装、Agent-as-a-Judge评估器设计、线上Trace自动转数据集,以及50KB大字段、跨账号只读授权、评估器一致性等一线坑点的解决思路。
3.数据飞轮如何反哺Agent自进化:BadCase回流→智能聚类与链路归因→评测集自动扩充,再借助经验库从真实轨迹中沉淀可复用经验、记忆库积累上下文,把评估结果转化为可验证的RL训练信号,让Agent越用越聪明;并附机审覆盖率5%→95%+、人工标注成本↓60%+、处理准确率96%+的量化复盘。
廖飞强
微众银行 技术研发经理
微众银行一线研发经理,目前主要负责数字金融相关项目研发,探索前沿技术,例如AI, 区块链等领域,都有一线的研发实践积淀。
待定
待定
测得准·比得明·练得强:异构框架下AI智能体全链路评估实践 
议题背景:
随着 AI 智能体从确定性问答演变为包含推理、检索和工具调用的多步骤决策系统,仅检查最终答案已难以准确判断其质量,更无法解释问题发生在哪个环节。
本次分享聚焦企业智能体上线前的离线质量评估,介绍一套兼容异构技术栈的全链路评估体系:通过测试集工程、低侵入分级接入和统一数据模型,综合评估智能体的结果、过程与运行表现;结合代码规则、LLM 裁判和人工校准,建立可信的评分机制;并通过可复用评估流水线、版本对比和回归验证,让评估真正进入研发质量流程。
分享还将结合会议智能体实践,展示如何利用过程 Trace 定位低概率问题、提升回归效率,并进一步介绍同一评估底座在在线价值治理和个人 AI 助理能力提升中的扩展思路。

内容大纲:
1. 背景与挑战:为什么 Agent 比传统软件更难评
从确定性输入输出走向非确定性、多步骤决策后,传统结果评测和服务监控面临的能力缺口。
2. 整体设计:一套评估底座与三条评估路径
上线前的离线质量评估、上线后的在线价值评估,以及个人 AI 助理成长评估。
3. 测试集工程:让评估建立在真实业务场景上
测试案例的导入、编辑、生成与持续维护,以及文档生成、从零构造、存量扩写等测试集冷启动方法。
4. 异构 Agent 的低侵入接入与全链路数据采集
分别适配已有 Trace、通用 API 和无 Trace 的存量系统,在不要求业务重构的前提下,逐级获得结果与过程数据。
5. 可信评估:指标体系与三轨评分机制
通过结果、过程、运行三类共 30 项内置指标及自定义指标,结合代码规则、LLM 裁判与人工校准,提高评分的准确性、可解释性和可复现性。
6. 工程闭环:从评估执行到版本质量治理
通过可复用流水线、趋势追踪、版本对比和回归验证,形成“评估、诊断、修复、再评估”的质量闭环,并探索与 CI/CD 质量门禁的结合。
7. 案例与扩展:从问题定位到规模化应用
以会议智能体为例,介绍 52 个测试案例、15 项自定义指标及低概率问题定位实践,并分享在线价值评估和桌面端个人助理评估的扩展方案。

听众收益:
1. 一套可直接复用的"过程评估"方法论与指标清单:6 类 20+ 过程指标体系 + 自定义扩展机制,带你跳出"只看结果"的评测盲区,真正测出 Agent 推理与工具调用的质量。
2. 异构框架零侵入 Trace 采集的完整工程路径:OpenTelemetry 标准协议 + 统一采集中枢 + Observation→Span 转换层的实现细节,可迁移到自己的技术栈,少走我们踩过的弯路。
3. 强约束场景下的评估架构范式与落地经验:内网 / 隐私敏感场景(零端口、零客户端改造)的安全评估设计,以及把评估嵌入 CI/CD、形成"以评促练"飞轮的实操套路。
王鹏昊
支付宝 算法工程师
任职于支付宝技术部,从事 GUI Agent方向研究工作。项目经验覆盖政务、出行、物流等垂类行业智能体的端到端评测,擅长 GUI Agent 训练调优等工作。
待定
待定
NovaFlow:从问答到办事的评测实践
议题背景:
晓政作为政务民生 AI 助手的核心挑战,不只是回答问题,而是能否在真实办事场景中理解用户意图、完成多轮交互、调用页面能力并给出可验证结果。传统评测更多关注单轮问答或离线指标,难以覆盖账号资格、页面操作、环境依赖、结果校验等端到端问题。本议题围绕晓政办事场景,分享如何建设面向真实任务的 benchmark 与评测集,如何通过语料合成、训练策略和训练环境建设提升 GUI Agent 的 UI 操作能力,以及在评测复现、badcase 归因、沙箱环境 和后训练数据闭环中的实践经验。

内容大纲:
1. 办事场景端到端评测问题拆解
1.1 政务民生 AI Agent 的评测目标:从“答得对”到“办得成”
1.2 办事场景与普通问答评测的差异:多轮交互、页面跳转、状态依赖、结果校验
1.3 端到端评测的核心难点:任务可执行性、页面稳定性、过程证据与失败归因
1.4 为什么需要 GUI Agent 作为评测执行器,而不只依赖离线问答指标
2. Benchmark 与评测集建设
2.1 办事任务拆解方法:用户意图、前置条件、操作步骤、页面动作、验收标准
2.2 评测集样本分层:可自动执行、半自动验证、暂不适合自动化执行
2.3 Benchmark 样本构造:任务描述、输入参数、预期结果、校验信号
2.4 badcase 标签体系:Agent 理解失败、页面操作失败、环境异常、样本不可执行、结果校验失败
3. GUI Agent 驱动的评测执行链路
3.1 GUI Agent 的角色定位:端到端评测执行器,而不是被评测对象
3.2 输入输出设计:任务指令、页面截图、操作动作、执行轨迹、校验结果
3.3 移动端 UI 执行框架:页面感知、动作生成、操作执行、截图回放、结果记录
3.4 MiniBench 复现方法:样本整理、batch prompts 构造、多轮执行、截图采集、结果回写
3.5 评测报告生成:成功率、失败类型、截图证据、可复现路径与问题归因
4. GUI Agent 后训练数据闭环
4.1 后训练目标:提升 GUI Agent 在真实办事页面中的 UI 操作稳定性
4.2 语料来源:真实办事流程、MiniBench 执行轨迹、人工标注操作序列、badcase 修正样本
4.3 语料合成:将用户意图、页面截图、动作步骤、校验结果组织成可训练样本
4.4 数据筛选:剔除环境异常、样本不可执行、账号状态阻塞等低质量轨迹
4.5 训练迭代:通过执行结果和 badcase 归因,反向补充高价值训练数据
5. 工程实践与踩坑经验
5.1 页面动态变化导致轨迹失效:如何通过截图回放和状态对齐辅助定位
5.2 任务执行过程不稳定:如何区分模型执行失败、页面异常和样本不可执行
5.3 真实业务场景难自动化:如何通过样本分层、前置条件标注和人工兜底降低误判
5.4 批量评测工程化:日志、截图、结果归因、报告沉淀如何串起来
6. 效果与后续演进
6.1 MiniBench 复现与晓政场景验证的阶段性结果
6.2 端到端评测体系带来的收益:更接近真实用户、更容易复盘、更能定位问题
6.3 后续方向:扩大办事场景 Benchmark、完善样本准入标准、沉淀评测数字员工能力
6.4 从评测结果到能力迭代:将 badcase、执行轨迹和结果归因持续反哺评测集与后训练数据建设

听众收益:
1. 理解办事场景 AI 助手的端到端评测方法,了解从 benchmark、评测集到结果归因的完整设计思路。
2. 获得 GUI Agent 后训练的实践经验,包括语料合成、训练策略、执行环境和 badcase 处理。
3. 了解真实业务落地中的关键坑点,如页面状态变化、环境异常等归因。
 
邵涛
腾讯 微信 算法工程师
腾讯 WXG 测试中心 IH-VQA 团队算法工程师,专注图像 / 视频质量评估模型的研发与落地。核心工作包括构建可解释差异感知框架、搭建视频号画质多模态大模型评估体系,并将其应用于编解码器 / 画质算法版本迭代的 A/B 可解释评测、拍摄美颜与 AIGC 特效等多候选效果图的算法选型支撑等场景,推动视频号、朋友圈、直播等核心产品的画质评测从人工盲测向标准化、可解释的 AI 流程演进。
待定
待定
腾讯微信 IH-VQA 团队首创 iDiff : 
多模态大模型在可解释双图对比评测中的实践与应用
议题背景:
传统图像质量评估(IQA)多输出单一标量分数,难以回答"为什么好、差在哪"等归因问题,在工程实践中价值有限。本议题提出双分支协同框架 iDiff:将判别式偏好预测(Answer Model)与结构化推理生成(Thinking Model)解耦,并结合多视图输入分解、多源特征注入、Answer-aware 指令微调等关键技术,解决了 MLLM"会讲不会判"与传统模型"会判不会讲"的矛盾。目前该方案已落地微信视频号盲测、编解码器 A/B 对比等核心业务场景,推动画质评估从人工质检升级为可归因的 AI 标准化流程。

内容大纲:
1. 问题与挑战
1.1 视频号 / 直播场景下的三类真实业务问题:版本对比、设备成片差异、AIGC 候选图优选
1.2 当前痛点:传统判别式小模型(给分不解释)/通用 MLLM(解释幻觉)
1.3 算法效果评估:判别准确率与推理过程的可靠性
2. iDiff 核心设计:双分支协同架构
2.1 Answer Model 三级增益路径
2.1.1 多视图输入分解:拼接图拆分为 4 路输入,准确率 0.5784 → 0.6961
2.1.2 内容感知专门化:人像 / 场景分而治之,场景子集准确率跃升至 0.8077
2.1.3 多骨干等权集成:5 个骨干模型投票融合,最终提升至 0.9118
2.2 Thinking Model 渐进式增强路径
2.2.1 模板化推理正则:领域专属模板 vs 通用模板,BLEU 从 0.0221 → 0.0858
2.2.2 多源特征注入:传统 CV 统计量 + 学习型 IQA 指标联合注入 Prompt,缓解"极相似图对判断模糊"问题
2.2.3 Answer-aware 指令微调:将 Ground Truth 写入 Prompt 驱动"理由精修",规避模型"答案复制"捷径
3. 工程落地与效能收益:iDiff 在微信核心业务中的规模化应用
3.1 视频号双栖盲测:从外包主观标注/小模型质检,到 iDiff 可解释大模型的升级
3.2 编解码器及画质算法迭代:替代单刺激 NR-IQA 与人工盲测,实现自动化、可定位的细粒度差异评估
3.3 一线创作工具选型支持:构建可批量、可解释、可归档的 AIGC / 影像工具标准化 PK 流程

听众收益:
1. 大模型画质评测落地思路:学习成对图像对比任务中的特征工程方法包括多视图拆解、领域分治、传统 CV 特征注入,缓解 MLLM 对极相似图像判断中的”幻觉"与"逻辑断层”问题,使得MLLM 在高精度、强可解释场景落地。
2. 标准化评测基建方案:获取一套可复用的自动化画质评测与 PK 架构,可直接迁移至 A/B 测试、竞品对比场景,降低人工质检成本。
关注QECon公众号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
135-2067-8913  媛媛
媒体合作
135-1619-6409  皮皮
添加QECon小助手,获取
会议最新资讯
购票咨询
13520678913  媛媛
服务总线
400-183-9980  
电话咨询
联系电话:
13520678913 媛媛