用 AI 监督 AI:芝麻信用 Agentic Coding 从需求到准出的
可信交付质量体系实践
议题背景:
AI Agent 开始参与需求理解、系统设计和测试验证;人的角色,也从逐行写代码的执行者,变成交付过程的监督者。我们在芝麻信用资金级业务的研发中发现,AI Coding 带来的主要挑战不只是代码幻觉,而是错误会跨阶段传播:需求里缺失的业务约束,设计阶段出现方案漏洞,到代码和测试阶段才表现为缺陷——越晚发现,代价越高。而需求评审、系分评审、CR 虽然覆盖每个节点,却靠人工发起和专家经验,跟不上 Agent 的产出速度。行业的集体困境,已经从"要不要用 AI"变成"铺开之后怎么管得住";我们的判断是:AI 时代的质量保障,对象不再只是最终的代码,而是 Agent 每一步的产出,检查必须自动化、跟着研发过程一起跑。
为此,依托蚂蚁集团成熟的软件工程规范,我们落地了 ACS(Agentic Coding Supervisor)。它不是另一个生码助手,而是与生码 Agent 隔离运行的质量监督者:在需求、设计、编码、测试、准出五个节点自动触发检查;确定性问题由静态规则判断,业务语义由大模型结合业务知识判断;问题返回 Agent 修复后必须用同一条规则复检,全程留痕、可审计。本次分享重点拆解四个工程问题:
1. 卡口如何集成于现有流程,并随 AI 参与度持续演进?
2. 企业经验如何变成可执行的规则?
3. 规则技能如何进化又不失控?
4. 验证证据如何自主产出并被有效消费?
分享将用两个来自真实生产的案例展开:一个高风险业务约束在编码前被完整拦截;一个问题跨需求、设计、代码阶段被连续闭环。我们也将公布系统在 [X 个月、X 个项目、X 次交付] 的运行数据——[风险前移比例、误报率与人工推翻率、修复闭环率、评审耗时变化、线上逃逸缺陷],用一组指标互证"系统更准了,而不是更少发现"——人工介入率持续下降的曲线,就是知识在体系中沉淀的曲线。
往业界方向看,我们相信:当 AI 从工具变成"专业员工",质量体系将从检测工具演进为 AI 研发的治理控制面——就像 CI/CD 之于 DevOps。听众将带走一套规模化阶段的落地经验:AI 工具已经铺开、质量问题规模化出现时,质量防线从哪切入、怎么持续有效,以及人机交互边界上的关键取舍。
内容大纲:
1. 传统质量保障跟不上 Agent 交付的时代命题
1.1 Agent 不只写代码,还参与需求理解、设计和测试验证——人从执行者变成监督者
1.2 错误跨阶段传播:需求缺约束 → 设计变漏洞 → 代码变缺陷
1.3 人工评审覆盖每个节点,但跟不上机器的产出速度
1.4 行业困境前移:工具已铺开,规模化之后质量怎么管得住
我们要解决的不是"再加一个检查工具",而是让质量保障跟着交付过程一起运行。
2. ACS 的独立监督架构
2.1 监督 Agent 与生码 Agent 隔离运行——裁判员和运动员不能是同一个人
2.2 五道质量卡口:需求、设计、编码、测试、准出——"证据齐备才放行"代替"人评审完点通过"
2.3 上下文、证据与放行状态如何流转
2.4 按风险分级:放行、降级、阻断
2.5 卡口不是补丁:流程形态随 AI 参与度持续演进
3. 质量评审规则设计:静态规则与开放规则的分工
3.1 静态规则:鉴权、路由、安全红线、编码规范等确定性边界
3.2 大模型:业务闭环、数据合规、灰度、幂等与文档实现一致性
3.3 规则来源:企业标准、专家经验、历史故障、单次需求 Spec
3.4 发现-修复-同规则复检闭环:避免"提示过了,但没真正解决"
4. 真实案例深度还原(本场核心)
选取真实交付中的完整案例,现场还原"从需求进入到准出放行"的全过程。每个案例按四步呈现:案例全貌 → 拦截现场 → 闭环过程 → 度量变化。以下案例为内容示例,届时会替换为更合适的真实案例。
* 案例一·数据合规:PRD 三处缺失在编码前被拦截
* 案例二·幂等跨阶段:同一缺口在需求、设计、代码三阶段呈现不同形态——缺决策、缺方案、缺实现——被连续拦截
* 案例三·验证智能化:从测试分析、造数到 E2E 的证据自动产出
5. 验证环节的智能化:从人工测试到证据自动产出
5.1 测试分析:回答"测什么"
5.2 场景化造数:回答"用什么测"
5.3 E2E 多端执行:模拟器、云真机、浏览器,截图断言留痕
5.4 知识库双向流动:消费获得业务理解,新发现沉淀回库
6. 从质量工具到质量基础设施:进化、度量与人机边界
6.1 规则进化:人工裁决回流、效果验证回退、阈值自动调节
6.2 安全红线:严重等级变更永远走人工评审
6.3 踩过的坑:误报绕过门禁、规则保鲜、同源模型共性盲区
6.4 指标互证:风险前移率、误报/推翻率、闭环率、线上逃逸缺陷;人工介入率作运营指标——其下降曲线就是知识沉淀的曲线
6.5 人机边界:确定性红线自动阻断,高风险决策留给人
6.6 规模化路径:从最痛节点切入,连点成线,治理能力与生码规模同步增长
听众收益:
1. 一套独立监督 Agent 的参考架构:规则、上下文、证据、复检与放行状态如何组成闭环。
2. 一套把企业规范和历史故障转化为阶段化质量门禁的方法,以及验证智能化(测试分析、场景化造数、E2E)如何接入同一闭环。
3. 误报治理、规则保鲜、共性盲区与人工兜底的真实失败经验。
4. 一套规模化阶段的落地经验:AI 工具已经铺开、质量问题开始规模化出现时,质量防线从哪个节点切入、怎么连点成线、怎么持续有效。