议题背景:
在复杂业务系统建设过程中,AI Coding 开始逐步融入研发流程,改变了需求分析、方案设计、代码实现、测试补充和问题修复等环节的协作方式。但随着 AI 深度参与研发流程,一个新的问题也逐渐显现:代码实现速度提升后,如何保证业务结果真正正确。
我司在建设埋点测试平台的过程中,尝试将 Claude、Codex 等 AI Coding 工具应用于研发与测试协作。平台能力逐步完善的同时,也暴露出新的质量挑战:部分问题并不是代码无法运行,而是系统没有报错、流程显示成功,最终业务结论却可能并不正确。
这类问题可概括为“假通过(False Pass)”:由于业务规则理解、查询边界、用例执行完整性或数据验证不足,系统可能给出看似合理、但无法支撑验收的结论;更严重的是,验证体系自身也可能在没有显性报错的情况下失效。
这让我们意识到,AI Coding 带来的不仅是开发方式变化,更要求重新定义“正确”如何被验证,以及“通过”如何被证明。
本次分享将结合埋点测试平台建设实践,复盘“假通过”的产生原因与治理过程,并介绍体系从 AI 自查 → 交叉审核 → 规则校验 → 资产沉淀 → 多 AI 并行可信测试 的演进路径:统一任务包驱动多条独立执行链路,需求解析、用例生成、测试执行、结果比对四个环节固定运行;再以真实执行记录、规则命中和置信度四维完成结论评判与决策路由,推动 AI Coding 从代码生成走向可信交付。
内容大纲:
1. 真实风险:AI Coding 时代,“正确”正在变得难以证明
1.1 提效之后,验证成为新的主要投入
AI 可以快速参与需求分析、方案设计、编码、测试与修复,但生成速度提升并不直接等于交付质量提升;
关键风险不在于系统是否运行,而在于业务结论是否真正成立;
当 AI 报告任务已通过时,仍需要回答:执行了什么、范围是否正确、证据在哪里。
1.2 两个典型案例:错误如何隐藏在“成功”里
案例一「查询范围静默失控」:查询条件解析异常后未触发报错,系统在错误范围内完成执行,验收报告却看似正常;
案例二「验证体系自身的假通过」:部分测试未被完整收集和执行,报告仍显示全绿;
两类问题共同说明:任务完成、报告生成和通过率结果,都只是信号,不是结论证据。
1.3 为什么“假通过”比报错更危险:问题的复杂性
它不一定抛异常,也不一定留下明确错误日志;
埋点验收同时受事件、属性、终端、业务线、时间窗口等多维规则影响,局部偏差可能生成看似合理的错误结果;
AI 的实现与验证若处于同一推理链,容易持续强化同一组假设,放大验证盲区。
2. 破解“假通过”:从单点修复到系统化防控的四轮演进
2.1 第一轮:人工复查与 AI 自查,很快失效
让 AI 对自己的结果进行复查,仍可能沿用相同假设;
人工逐条核对能够发现问题,但难以支撑持续规模化运行;
结论是:同一推理链内部,难以稳定发现自身的假设错误。
2.2 第二轮:实现与审查分离,双 AI 独立审查
由不同 AI 分别承担实现与审查职责,审查侧负责提出反例、挑战边界、补充问题项;
人工确认审查发现,避免将审查结论直接作为最终事实;
独立审查可以增加发现问题的机会,但其结论同样需要经过证据验证。
2.3 第三轮:规则校验,把问题判断转化为系统约束
将事故中暴露的判断条件固化为可执行规则,而不是依赖后续人工记忆;
规则在需求解析、用例生成和结果比对等阶段介入,补齐遗漏场景并约束判定结果;
命中规则后保留处理记录,使问题判断可检查、可回放。
2.4 第四轮:把每个问题变成资产,防复发体系
将问题固化为规则、黄金用例、回归 E2E、验收口径和项目经验;
规则与用例随项目持续演进,成为后续任务默认生效的约束;
不仅修复当前问题,更降低同类问题再次发生的概率。
3. 方法沉淀:一套可复制的多 AI 并行可信测试体系
3.1 任务层:统一任务包与上下文隔离
将需求、验收口径、规则与执行约束统一封装为任务包;
多条 AI 执行链路并行处理同一任务,但不共享中间结论;
通过上下文隔离与不合规链路剔除,避免单一推理路径主导最终判断。
3.2 执行层:需求解析、用例生成、测试执行、结果比对
需求解析:将需求文本转化为可验证的需求清单与验收断言;
用例生成:围绕需求清单生成测试场景,并补齐规则要求的覆盖项;
测试执行:以真实执行结果作为判定输入,保留执行过程与结果记录;
结果比对:逐项对照验收口径,并归并为需求级结论。
3.3 规则层:规则注入、命中留档与过程可回放
规则不只是文档要求,而是参与任务执行的可配置约束;
在用例生成和结果比对阶段自动注入、校验并记录命中结果
规则版本、命中过程与处理结果可追溯,为后续复核提供依据。
3.4 评判层:置信度、规则命中与决策路由
以一致性、覆盖度、执行质量、证据完整度构成置信度评判;
底线规则处理不可接受的高风险情形,阈值规则约束自动通过的最低条件;
最终输出自动通过、人工审核或人工介入,使不同风险等级进入对应处理路径。
4. 落地验证:从体系设计到平台运行
4.1 运行成效:执行规模、规则覆盖与验收效率
基于实际需求验收,展示执行链路、用例覆盖、规则覆盖、耗时与成本等运行指标;
验证多链并行、统一任务包与固定执行流程在持续验收场景下的可运行性;
评估从任务输入到验收结论的整体效率。
4.2 决策成效:多链对比、结论评判与分级处置
对多条执行链路的结论进行一致性、覆盖度、执行质量与证据完整度评判;
结合规则命中情况,识别结论分歧、覆盖缺口与高风险事项;
按自动通过、人工审核、人工介入三类路径完成分级处置与结果留痕。
4.3 质量成效:问题发现、规则补强与回归验证
对运行中发现的问题进行分级管理,并形成规则预设与人工确认闭环;
将典型问题补充为规则与回归 E2E,验证修复结果并防止同类问题复发;
通过规则、用例与执行记录的持续积累,提升验证体系的稳定性与可维护性。
4.4 复用成效:规则资产与评判能力跨场景应用
将已沉淀的规则、用例和评判口径复用至其他测试平台与业务场景;
在不同测试对象之间保持任务输入、规则表达和结论判断的一致性;
持续扩大验证范围,降低重复人工核验成本。
听众收益:
1.识别复杂业务场景下 AI Coding“假通过”的典型模式,避开“系统正常运行 = 结果正确”的认知陷阱;
2.获得一套经过真实平台运行验证的防控方法:交叉审核 → 规则校验 → 资产沉淀 → 多链独立执行与证据评判,可迁移至自身项目;
3.理解 AI Coding 从个人提效走向团队级可信交付所需的工程能力,包括统一任务、规则约束、过程留痕与分级决策。