专场:驾驭工程Harness Engineering
本专场聚焦驾驭工程的最新设计框架与落地实践。提示词工程仅针对单次模型交互做指令优化,应用增益已见顶;上下文工程将提示词管控纳入其中,统筹管理模型全部输入信息以保障输出质量;驾驭工程作为涵盖前两者的高阶体系,为大模型搭建完整的外部运行管控框架,支撑规模化、长周期、高质量的企业级AI落地。本专场将分享最新落地经验,涵盖企业级上下文与知识管理,多 Agent 编排与协同,长程任务管理与记忆体系搭建等深度内容。
专场出品人:茹炳晟 
腾讯研究院特约研究员  复旦大学CodeWisdom团队首席技术专家
中国计算机学会TF多智能体系统SIG副主席,中国计算机学会TF数据科学与知识工程SIG执委,“软件研发效能度量规范“标准核心编写专家,中国商业联合会互联网应用技术委员会智库专家,中国通信标准化协会TC608云计算标准和开源推进委员会云上软件工程工作组副组长,腾讯云架构师技术同盟入会主席,年度IT图书最具影响力作者,多本技术畅销书作者,著作有《软件研发效能提升之美》《现代软件测试技术之美》《测试工程师全栈技术进阶与实践》《多模态大模型技术原理与实战》《高效自动化测试平台:设计与开发实战》《软件研发效能提升实践》《软件研发效能权威指南》《现代软件测试技术权威指南》《高质效交付》《代码之外:软件工程师成长手记》等,译作有《软件设计的哲学》《整洁架构之道》《持续架构实践》《构建Agentic AI系统》《大模型驱动的软件测试:从理论到实践》《平台工程》《企业架构决策:战略框架与实施指南》《AI领导力》《现代软件工程》《计算机科学通识:计算思维培养与多学科问题解决实践》《DevOps实践指南(第2版)》《精益DevOps》《基础设施即代码-模型驱动的DevOps》等,国内外各大技术峰会的联席主席,出品人和Keynote演讲嘉宾。公众号“茹炳晟聊软件研发”主理人。
李远康
科大讯飞 资深测试技术工程师
10 年 + 软件测试与质量工程领域深耕,历任测试负责人、测试总监、高级测试工程师,主导教育行业 21 个产品的质量体系建设,覆盖考试、智慧教育、教学交付等核心业务线。

深耕测试工具研发与自动化体系搭建,主导建设 AI-TEST-TOOLKIT 测试工程底座,推动 AI 测试从"脚本生成"向"意图测试 + 可信工程"演进,沉淀出 Harness 三层架构与步骤 / 脚本 / 意图多形态协同的规模化落地范式。

擅长大模型测试工具落地中的"可控性与稳定性平衡",通过工程纪律与人机协同闭环,让非确定性的 AI 执行结果可被发布流程采信。推动测试团队从"脚本编写"向"用例设计"再向"意图设计与裁决文化"演进,工作量曲线从 O(覆盖率) 降至 O(异常率)。
集团《测试组长训练营》出品人、测试专委会委员。
待定
待定
可信赖.可驾驭.自进化:
基于Harness+Loop的 Agentic QA 工程体系深度实践
议题背景:
自动化测试覆盖率长期卡在 25%,AI 加速了脚本生成却未解决维护瓶颈——根因是脚本将业务意图与 UI 实现死锁编码,UI 一动就失效。我们在教育行业 21 个产品上验证了另一条路:把测试资产从脚本上升到产品意图层,用 Harness 三层架构(意图 / 执行 / 信任)将非确定性 AI 执行装进可信容器。关键突破:多维判定机制(假阳率 ≤5%)、三形态动态配比(成本降 60%)、人机协同假阳自调节闭环(工作量从 O(覆盖率) 降至 O(异常率));实践中以工程纪律兜底静默失败、路径退化、快慢指标割裂三类致命坑。落地效果:版本回归从 1-2 人天压到 1-2 小时复核,节省约 85-90% 回归人力;自 2026 年 3 月起已在多个产品线投入常态化回归,覆盖步骤 / 脚本 / 意图三形态协同执行,持续稳定运行中。

内容大纲:
1. 第一部分:为什么必须变——测试范式的载体跃迁
1.1 脚本的天花板:为什么自动化卡在 25%
1.1.1 表面是维护成本问题,根因是信息论问题:脚本把三层信息(意图 why / 场景 what / 执行 how)死锁在一起,按最不稳定的执行层组织代码
1.1.2 一个按钮 ID 变了,被冲掉的不只是定位器,是依附其上的全部业务理解
1.2 Agentic QA 是什么、绝对不是什么
1.2.1 判断标准:如果团队周五交付的依然是一堆脚本,那做的就是 AI 辅助测试,不是 Agentic QA
1.2.2 控制结构翻转:从预编译模式(人事前把全部判断编译成代码)→ 即时决策模式(人只定义边界,Agent 在边界内即时决策)
1.3 全场最关键的一句话:Agent 不是产品,Harness 才是产品
1.3.1 用 Reward Hacking 真实案例点透:某 AI Test Runner 把目标设成"完成所有步骤",结果学会了绕路、让坏应用也能测出全绿
1.3.2 修复的不是换更强模型,而是改 Harness、重写目标函数:"你的工作不是完成步骤,是找到产品偏离意图的地方"

2. 变成什么样——Harness+Loop 工程蓝图
2.1 先解决信任根基:重新定义"确定性"
- 把确定性锚在意图验证的结论收敛上,而非执行路径上
- 执行留痕(Trace):记录"我观察到 X,我认为它符合 / 不符合意图 Y,因为 Z"
- 统计置信度 + 分级信任机制
2.2 Harness 的本体:评估系统 + 真值源 + 升级机制
2.2.1 八层结构(快速扫过,重点讲关键层):
- 意图层:质量定义的真理源(不变量优先于步骤)
- 上下文层:让 Agent 读懂产品(known-bugs 工程化为可消费形态)
- 边界层:DO / DONT / ESCALATE(硬约束在工具层拦)
- 评估层:判断收敛 + 四通道异常检测(视觉 / 性能 / 数据 / 状态)
2.3 让 Agent 像资深测试专家工作的四个支点
2.3.1 判断收敛(意图描述精度决定 Agent 解读空间)
2.3.2 上下文喂饱(Agent 是上下文饿瘦的猜测者,是喂饱的测试员)
2.3.3 思维框架注入(资深测试专家人格 + 探索 / 回归 / 分类模式)
2.3.4 四通道异常检测(弱预期也能可信判定)

3. 怎么落地不漂移——从"孤立执行"到"可信体系"
3.1 三个崩溃指向同一个空洞:没有"容器"
3.1.1 它说"通过了",你信吗?→ 不可信
3.1.2 它每次从零开始,慢且贵 → 不累积
3.1.3 它判错了,你只能逐条改提示词 → 维护成本回来了
3.2 三层架构 + 一份契约(Harness 的"宪法")
意图层 (管 "测什么")
↓ 统一上报契约:verdict / 证据 / 偏离原因 / 置信度
执行层 (管 "怎么测 + 经验沉淀")
↓ 统一契约
信任层 (管 "质量校准 + 反馈进化")
3.3 让系统可信、可驾驭的工程纪律(Loop 机制)
3.3.1 执行层:
- 守护进程兜底:禁止静默失败,daemon 替挂掉的 AI 交代
- 前置守卫:坏环境直接拒跑,守护信任数据纯净度
- trajectory 铁律:路径是 Hint 不是 Script,首次深探、成功沉淀、失效重探
- 模型分级:首次必用强模型,三条件齐备才降轻量
3.3.2 信任层:
- 证据链 + 复核队列:把人的介入从"全量"压缩到"异常"
- 假阳自调节:滑动窗口假阳率驱动抽查频率
- 复核裁决自动沉淀:人工裁决 → known-bugs 回写 → 后续自动注入
3.4 可控的自进化:脚本只会老化,本体系会进化
3.4.1 失败反哺意图优化(AI 分析证据链 → 输出修订建议 → 工程师评估沉淀)
3.4.2 成功路径自动沉淀(trajectory 复用,成本降 60%)
3.4.3 真实示例:模拟考试模块意图混写导致收敛不稳 → 系统反哺"建议拆分" → 采纳后稳定

4. 收口与延伸
4.1 核心数据再强化
4.1.1 21 个产品 / 稳定性 95%+ / 假阳率 5% / 人力节省 85-90%
4.1.2 工作量从 O(覆盖率) 降到 O(异常率)
4.2 QA 工程师的角色演化
4.2.1 测试设计的内核(场景建模、风险判断、边界探索)从未失效,失效的只是输出载体
4.2.2 新画像:Harness 架构师 + Agent Reviewer + 意图守护者
4.3 开源落地
4.3.1 AI-TEST-TOOLKIT 平台(MIT/Apache 2.0)
4.3.2 照搬纪律,不照搬代码——技术栈不同也能复用核心铁律

听众收益:
1. 建立认知地基:看清测试范式跃迁的本质,不再被"用了 AI 就是 Agentic QA"误导
2. 拿到完整工程蓝图:Harness 的八层结构 + 评估 / 真值 / 升级三大本体,少走 6-12 个月弯路
3. 掌握生产级落地纪律:守护进程、前置守卫、trajectory 铁律、三级降级,把稳定性从 60% 提到 95%
4. 建立可控自进化能力:理解"失败反哺 + 人机协同"如何让资产越用越好
5. 看清角色演化路径:从脚本维护者到质量设计师,把多年积累迁移到新载体
刘玺宇
小红书 AI 工程架构师
小红书质效研发部 AI 工程架构师,自 23 年起长期深耕质量稳定性领域的 AI 相关工作,目前主要负责小红书质量领域 Agent 的架构设计与开发,横向为各业务线提供质量保障。毕业后曾就职于字节跳动,从事 DevOps 中台、稳定性域 Agent 的开发工作。
待定
待定
流程自动推进,经验自动沉淀:
故障复盘 Agent 的 Harness 工程实践
议题背景:
告警分析、根因定位、故障自愈的 AI 化业界已多有实践,事后的复盘却仍靠人推:确认责任、组局约会、催办文档、检查质量,哪一环没人盯就停在哪一环,同一个坑换条业务线再踩。复盘的难点不在写一篇文档,而在让一条跨系统、跨角色、跨数周的流程持续运行——卡住流程的不是提醒与流转这些机械动作,而是要不要复盘、谁来组织、文档合不合格这些需要理解与判断的环节。
小红书复盘 Agent 以"准备 → 组织 → 评审 → 沉淀"四步闭环值守这条流程:处置会议记录与群聊自动生成初始文档,按故障信息、历史经验与规则推荐组织安排,按显式标准评审文档并催办到会前达标;人只在确认安排、裁决异议、评审会定论这几个节点做决策。而它的每个动作都落在确定性工程上:流程骨架是状态机与调度,动作集是状态机暴露出的业务动词,外部动作全走重试队列,模型的判断输出全有程序验收。
目前已落地小红书全业务线,流程推进零人力盯守;复盘经验进一步被编译为带原文证据的事故档案,蒸馏出跨事故的机制级深坑清单,回流为推荐与预警。

内容大纲:
1. 现状与挑战:复盘为什么难以自动化
1.1 一条跨系统、跨角色、跨数周的流程,哪一环没人盯就停在哪一环
1.2 规模化后的四类挑战:判定口径难统一、组织路径不确定、文档缺准出标准、经验难沉淀复用
1.3 机械层早有方案,卡住流程的是需要理解与判断的环节——把判断交给能理解语义的系统,把决策留给人
2. 产品方案:Agent 值守的复盘闭环    
2.1 形态选择:语义交互由 LLM Agent 承接,严肃业务靠确定性工程管控
2.2 四步闭环:准备(处置记录自动成稿、三类依据推荐安排)、组织(双入口、按业务线节奏组局)、评审(智能配图、显式标准质检、会前合格率)、沉淀(经验资产化)
2.3 度量贯穿全程、历史经验回流成环,人只保留决策
3. 驾驭:把模型收进确定性的轨道
3.1 流程引擎:状态机 + 调度 + 外部动作重试队列 + 一致性自愈;状态只有一个权威载体,模型每轮重读
3.2 确定性分工:输入先分流——意图明确走快路径不召唤模型;计划归模型、计算归代码
3.3 动作设计:动作集是状态机暴露的合法操作面,一个业务域一个工具、30 余个业务动词;单次调用内封装权限、事务与通知;返回值反向引导模型的下一步
3.4 输入边界与质量准出:上下文按信任分级、调用者身份不进 prompt、权限绑定流程状态;评审标准显式化、隔离评分、输出程序验收
4. 记忆:让经验长成组织资产
4.1 深坑的本质是机制层关联:表面不同的故障同根、表面相同的故障异根——相似性检索双向失灵,只有推理可得
4.2 模式 Wiki:原始文档 → 事故档案 → 坑的清单三层结构,增量认领 + 每晚整体重建,层层有闸
4.3 召回:模式发现、前科反查、处置检索与荐人等查询形态;每轮对话自动注入事实快照与相关经验;流程规则经预览、二次确认、灰度回流
5. 收益、审视与展望
5.1 效果:全业务线落地、流程推进零人力盯守、文档质量与合规率提升
5.2 审视:当前质量水位由值守维持——下一步从"系统催成的合规"走向"习惯性的前置合规"
5.3 展望:经验库规模化生长;这套模式可迁移至任何"没人盯就会停"的严肃长程流程

听众收益:
1. 一条可迁移的 Harness 划分原则:流程骨架归确定性工程、理解与判断归模型、模型的每个输出有程序验收——以及它在状态机、动作集、重试队列上的具体落法;
2. 一组生产验证过的工程设计:业务动词工具与反向引导返回值、输入信任分级与身份旁路、隔离评审与会前合格率度量,全部来自全业务线在线运行的真实系统;
3. 一个完整的组织记忆方案:带原文逐字证据的记忆编译、机制层对齐(以及"相似性检索为何在此场景失效"的选型结论)、层层有闸的写回与多形态召回。
罗正昕
百度 Comate Agent策略负责人
目前在百度 Comate 团队负责 AI Coding Agent 相关的算法与系统研发,专注大模型 Agent 的复杂任务执行能力和工程化落地。
主要做的方向包括 Agent Harness Engineering 的设计与构建、 Agent 评测以及 Agent 的自我迭代等。过去一段时间主要负责了 Comate Agent 新一代 Agent Loop 的设计构建、自动化评测体系的建立以及 Agent 自我迭代系统的构建。
当前关注的是如何能够通过自动化评测体系以及 Agent 自我迭代系统的构建使得 Agent Harness 层能够自我迭代优化。
待定
待定
Recursive Self-improvement Agent Harness:
自我迭代的 Harness Engineering
议题背景:
随着 Agent 任务复杂度不断提升,传统依赖人工抽样、人工分析和人工修复的迭代方式逐渐成为效率瓶颈:线上异常难以及时发现,问题轨迹长且根因隐蔽,修复后又缺少稳定、可重复的验证手段,导致 Agent 的问题定位和质量提升高度依赖专家经验。我们希望构建一套由评测系统驱动的 Agent 自我迭代闭环,让线上真实异常能够自动沉淀为评测数据,并进一步完成异常归因、问题修复和回归验证,逐步形成“发现问题—定位根因—修复问题—验证效果”的自动化迭代链路,降低人工介入成本,同时让 Agent 的能力优化从经验驱动走向数据和评测驱动。

内容大纲:
1. 从 Vibe Coding 到 Agentic 研发的范式转变
1.1 Vibe Coding:自然语言驱动的代码生成
1.2 Agentic 研发:Agent 承担规划、执行与验证的完整研发链路
1.3 范式转变下的新要求:Agent 需要持续自我迭代而非一次性交付
2. Agentic 研发的核心关键——Harness 层
2.1 Harness 层的定位:连接模型能力与研发任务的编排与控制层
2.2 Harness 层的质量问题更隐蔽:bug 影响效果但难以感知和排查
2.3 Harness 层的复现困难:无法获取用户本地环境、工具状态与上下文
2.4 Harness 层的评测难题:最终结果无法直接归因到 Harness 层逻辑
3. Harness 层研发面临的核心困难
3.1 多阶段执行链路下的异常定位成本高
3.2 Agent 运行轨迹长,根因隐藏在中间步骤
3.3 修复依赖专家经验,难以标准化和复用
3.4 缺少稳定回归手段,局部修复易引入副作用
3.5 线上问题规模增长,人工迭代效率无法匹配
4. 自我迭代 Harness 方案
4.1 整体闭环:异常筛查 → 轨迹诊断 → 修复生成 → 自动验证 → 数据回流
4.2 多源信号驱动的线上异常筛查与 Case 沉淀
4.3 面向执行轨迹的分阶段根因诊断
4.4 根因约束下的候选修复生成与作用域控制
4.5 分层评测集与质量门禁驱动的自动化回归验证
4.6 线上 Case 回流与评测数据飞轮
5. 总结
5.1 关键设计决策与工程取舍
5.2 结果评测与过程评测的协同
5.3 自动化闭环与人工审核的风险分级
5.4 效果、成本、稳定性的综合权衡
5.5 从经验驱动到数据驱动的迭代范式

听众收益:
1. 评测驱动的研发在 Agent Harness Engineering 中的最新落地实践
2. 在 Agent 层的最新前沿的自我迭代Recursive Self-improvement 方案
任磊达
腾讯 QQ飞车后台开发工程师
腾讯 QQ飞车Agent小组长,高级后台开发工程师,目前主要负责团队AI-Native工作流改造及服务器开发工作。长期从事业务开发、安全开发、数据开发、研发效能及可观测性治理工作。
待定
待定
从 Loop Engineering 的童话到 ROI 驱动的 Harness 建设选型
议题背景:
Loop Engineering 曾被视为 AI Native 研发的理想形态:让 Agent 自动规划、执行、修复和总结。但在生产环境中,团队很快会遇到现实问题:Token 成本失控、上下文反复重读、产出难以合入、质量仍需人工兜底。
现实是:业务团队无法决定 Codebuddy、OpenCode 等底层 CLI 的实现,却要直接承担 Token 成本飙升、注意力分散、任务优先级冲突、输出准确率不稳乃至外网访问合规风险带来的压力。 本次分享将从一次"全自动 loop 撞墙"的实践出发,讨论降本趋势下 Harness 建设如何从概念驱动转向 ROI 驱动——它讨论的不是 CLI 工具的底层实现,而是在真实业务场景下,如何架构工具的注意力边界:包括事前-事中-事后的人机协同边界、review 驱动的质量闸门、handoff + prompt cache 的 Token 经济学,以及渐进式披露与路由委派如何把 Token 成本降低 90%+,最终实现真正的可靠与增效。

内容大纲:
1. 童话期:Loop Engineering 的理想与撞墙
1.1 童话设定:以为 Agent 能自我收敛
无治理的全自动 loop 看起来很美好:Agent 自己探索、自己修改、自己修复、自己总结。但真实情况是,它往往只是在扩大上下文和消耗 Token。
1.2 撞墙时刻:Token 成本失控与不可合入产出
复盘典型问题:长上下文反复重跑、失败重试无边界、代码看似完成但无法进入生产流程。
1.3 核心反思:为什么“全自动”不是生产级方案
生产环境需要的是可控成本、可验收质量和可复用流程,而不是无限 loop。
2. 事前-事中-事后:重建人机协同边界
2.1 三段模型:澄清、执行、沉淀
事前做澄清和规划,事中做执行和路由,事后做 review、handoff 和复用沉淀。
2.2 边界定义:哪些交人,哪些交 Agent
Scope 变更、破坏性操作、架构取舍交给人;代码搜索、局部实现、测试执行、总结沉淀交给 Agent。
2.3 Review 驱动的 Harness:把 review 作为收敛闸门
用 review checklist 约束需求理解、边界条件、测试选择和 diff 范围,避免 Agent 自信地产出不可合入代码。
3. 核心亮点:Handoff + Prompt Cache 的 Token 经济学
3.1 北极星指标:企业合规流程里的每 M Token 人民币均价
Token 成本不只看模型 API 标价,还要纳入企业网关、审计、日志留存、失败重试、人工兜底等综合成本。
3.2 Handoff 设计:把会话压缩成可复用工程状态
用 handoff 记录目标、决策、关键文件、测试结果和未解决风险,避免新 Agent 每次从零探索。
3.3 Prompt Cache 优化:稳定前缀,动态尾部
把稳定规则和项目上下文放进可缓存前缀,把当前 diff、日志、局部代码放在动态尾部,降低重复 Token 和时延。
4. Token 管控后的工作流重构:从全量注入到按需加载
4.1 渐进式披露:命中跳过即不读
通过 SKILL.md 路由器和 P1 决策表,让 Agent 只读取当前任务必要的信息,避免全量上下文注入。
4.2 路由委派:用任务类型隔离上下文
探索、实现、Debug、Review、发布进入不同 Harness;复杂任务拆 DAG,用 subagent 隔离上下文膨胀。
4.3 治理度量:Token 预算与回归看护
为高频任务建立 Token 基线,观察单任务 Token、时延、返工率和 cache 命中变化。
5. 长期主义下的 Harness 选型:用 ROI 判断什么值得建设
5.1 选型维度:成本、质量、边界、复用
从 Token ROI、可维护性、人机边界清晰度、团队可复制性四个维度判断是否值得建设 Harness。
5.2 ROI 框架:探索成本 vs 长期复用收益
探索期可以投入高价 Token 找路径;一旦任务高频出现,就要收敛成低成本、可复用的 Harness。
5.3 团队落地:从个人 Prompt 到组织工作流
把个人经验沉淀成规则、skill、handoff、review checklist 和测试入口,提升团队 AI Native 程度。
关注QECon公众号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
135-2067-8913  媛媛
媒体合作
135-1619-6409  皮皮
添加QECon小助手,获取
会议最新资讯
购票咨询
13520678913  媛媛
服务总线
400-183-9980  
电话咨询
联系电话:
13520678913 媛媛