可信赖.可驾驭.自进化:
基于Harness+Loop的 Agentic QA 工程体系深度实践
议题背景:
自动化测试覆盖率长期卡在 25%,AI 加速了脚本生成却未解决维护瓶颈——根因是脚本将业务意图与 UI 实现死锁编码,UI 一动就失效。我们在教育行业 21 个产品上验证了另一条路:把测试资产从脚本上升到产品意图层,用 Harness 三层架构(意图 / 执行 / 信任)将非确定性 AI 执行装进可信容器。关键突破:多维判定机制(假阳率 ≤5%)、三形态动态配比(成本降 60%)、人机协同假阳自调节闭环(工作量从 O(覆盖率) 降至 O(异常率));实践中以工程纪律兜底静默失败、路径退化、快慢指标割裂三类致命坑。落地效果:版本回归从 1-2 人天压到 1-2 小时复核,节省约 85-90% 回归人力;自 2026 年 3 月起已在多个产品线投入常态化回归,覆盖步骤 / 脚本 / 意图三形态协同执行,持续稳定运行中。
内容大纲:
1. 第一部分:为什么必须变——测试范式的载体跃迁
1.1 脚本的天花板:为什么自动化卡在 25%
1.1.1 表面是维护成本问题,根因是信息论问题:脚本把三层信息(意图 why / 场景 what / 执行 how)死锁在一起,按最不稳定的执行层组织代码
1.1.2 一个按钮 ID 变了,被冲掉的不只是定位器,是依附其上的全部业务理解
1.2 Agentic QA 是什么、绝对不是什么
1.2.1 判断标准:如果团队周五交付的依然是一堆脚本,那做的就是 AI 辅助测试,不是 Agentic QA
1.2.2 控制结构翻转:从预编译模式(人事前把全部判断编译成代码)→ 即时决策模式(人只定义边界,Agent 在边界内即时决策)
1.3 全场最关键的一句话:Agent 不是产品,Harness 才是产品
1.3.1 用 Reward Hacking 真实案例点透:某 AI Test Runner 把目标设成"完成所有步骤",结果学会了绕路、让坏应用也能测出全绿
1.3.2 修复的不是换更强模型,而是改 Harness、重写目标函数:"你的工作不是完成步骤,是找到产品偏离意图的地方"
2. 变成什么样——Harness+Loop 工程蓝图
2.1 先解决信任根基:重新定义"确定性"
- 把确定性锚在意图验证的结论收敛上,而非执行路径上
- 执行留痕(Trace):记录"我观察到 X,我认为它符合 / 不符合意图 Y,因为 Z"
- 统计置信度 + 分级信任机制
2.2 Harness 的本体:评估系统 + 真值源 + 升级机制
2.2.1 八层结构(快速扫过,重点讲关键层):
- 意图层:质量定义的真理源(不变量优先于步骤)
- 上下文层:让 Agent 读懂产品(known-bugs 工程化为可消费形态)
- 边界层:DO / DONT / ESCALATE(硬约束在工具层拦)
- 评估层:判断收敛 + 四通道异常检测(视觉 / 性能 / 数据 / 状态)
2.3 让 Agent 像资深测试专家工作的四个支点
2.3.1 判断收敛(意图描述精度决定 Agent 解读空间)
2.3.2 上下文喂饱(Agent 是上下文饿瘦的猜测者,是喂饱的测试员)
2.3.3 思维框架注入(资深测试专家人格 + 探索 / 回归 / 分类模式)
2.3.4 四通道异常检测(弱预期也能可信判定)
3. 怎么落地不漂移——从"孤立执行"到"可信体系"
3.1 三个崩溃指向同一个空洞:没有"容器"
3.1.1 它说"通过了",你信吗?→ 不可信
3.1.2 它每次从零开始,慢且贵 → 不累积
3.1.3 它判错了,你只能逐条改提示词 → 维护成本回来了
3.2 三层架构 + 一份契约(Harness 的"宪法")
意图层 (管 "测什么")
↓ 统一上报契约:verdict / 证据 / 偏离原因 / 置信度
执行层 (管 "怎么测 + 经验沉淀")
↓ 统一契约
信任层 (管 "质量校准 + 反馈进化")
3.3 让系统可信、可驾驭的工程纪律(Loop 机制)
3.3.1 执行层:
- 守护进程兜底:禁止静默失败,daemon 替挂掉的 AI 交代
- 前置守卫:坏环境直接拒跑,守护信任数据纯净度
- trajectory 铁律:路径是 Hint 不是 Script,首次深探、成功沉淀、失效重探
- 模型分级:首次必用强模型,三条件齐备才降轻量
3.3.2 信任层:
- 证据链 + 复核队列:把人的介入从"全量"压缩到"异常"
- 假阳自调节:滑动窗口假阳率驱动抽查频率
- 复核裁决自动沉淀:人工裁决 → known-bugs 回写 → 后续自动注入
3.4 可控的自进化:脚本只会老化,本体系会进化
3.4.1 失败反哺意图优化(AI 分析证据链 → 输出修订建议 → 工程师评估沉淀)
3.4.2 成功路径自动沉淀(trajectory 复用,成本降 60%)
3.4.3 真实示例:模拟考试模块意图混写导致收敛不稳 → 系统反哺"建议拆分" → 采纳后稳定
4. 收口与延伸
4.1 核心数据再强化
4.1.1 21 个产品 / 稳定性 95%+ / 假阳率 5% / 人力节省 85-90%
4.1.2 工作量从 O(覆盖率) 降到 O(异常率)
4.2 QA 工程师的角色演化
4.2.1 测试设计的内核(场景建模、风险判断、边界探索)从未失效,失效的只是输出载体
4.2.2 新画像:Harness 架构师 + Agent Reviewer + 意图守护者
4.3 开源落地
4.3.1 AI-TEST-TOOLKIT 平台(MIT/Apache 2.0)
4.3.2 照搬纪律,不照搬代码——技术栈不同也能复用核心铁律
听众收益:
1. 建立认知地基:看清测试范式跃迁的本质,不再被"用了 AI 就是 Agentic QA"误导
2. 拿到完整工程蓝图:Harness 的八层结构 + 评估 / 真值 / 升级三大本体,少走 6-12 个月弯路
3. 掌握生产级落地纪律:守护进程、前置守卫、trajectory 铁律、三级降级,把稳定性从 60% 提到 95%
4. 建立可控自进化能力:理解"失败反哺 + 人机协同"如何让资产越用越好
5. 看清角色演化路径:从脚本维护者到质量设计师,把多年积累迁移到新载体