专场:生产级 AI Coding 实战:效率与质量的平衡术 
AI 正在深度改写代码生产全流程,AI Coding 大幅压缩编码工时,快速带来开发效率跃升,但也随之引出诸多现实生产难题:AI 生成代码如何落地到真实业务系统?怎样平衡编码提速与代码质量风险?如何解决 AI 输出 “假通过”、缺陷遗留等线上隐患?生产环境下 AI Agent 该如何调优迭代?从代码生成走向可靠可信交付,流程、基建、协同又该补齐哪些能力?带着这些现实痛点,本专场汇聚一线实战专家,分享生产环境下 AI Coding 与代码智能体的真实落地案例,探讨效率与质量之间的权衡实践,拆解从 0 到 1 搭建修缺陷 AI Agent、Agent 调优、风险识别防控、基建补齐等一手实操经验,共同探索 AI Coding 在业务生产中可行的落地路径。
专场出品人:张琦 
华为 研发大模型团队 研发智能体技术专家
华为 研发大模型团队 研发智能体技术专家 。主要负责AI研发助手CodeArts Snap的竞争力建设以及能力交付,端到端负责数据准备,模型训练,模型评测,服务交付。
秦宙恺
群核科技 测试开发专家
三笠 群核科技 测试开发专家
群核科技全球数智测试组负责人,在群核科技任职11年,担任过多条业务线质量负责人,带领过四五个不同业务线的测试团队,涵盖主站、工具、koolab、国际化等业务。曾经负责上海分公司质量团队的组建工作,有过多个从零搭建质量效能体系的经验。从自动化能力建设、工具平台能力建设到性能领域都有深度实践。当前在公司AI转型领域有较多深度实践,为公司AI-testing团队负责人。
待定
待定
AI Native 单兵实战:AutoDebug Agent
议题背景:
大模型会写缺陷分析报告,不代表它真的修好了缺陷。
本次分享将复盘一个人如何从真实缺陷出发,把最初的分析脚本逐步改造成能够进入代码仓库、定位根因、直接修改代码、完成验证并交付修复结果的 AutoDebug Agent。
整个过程没有先设计一个庞大的平台,而是持续读取真实失败,每次只改变一个关键断点,再用修前失败、修后通过的证据判断改动是否有效。最终形成了一套由真实反馈持续驱动的缺陷处理闭环。

阶段成果:
1. 268 个真实缺陷进入处理闭环
2. 133 个代码修复完成交付
3. 132 个结果形成正式记录
4. 已复核样本中,诊断准确率达到 92.5%
5. 替代就绪度达到 81.3%
6. 累计完成 436 次 Replay
7. 其中 389 次形成可比较的基线证据

内容大纲:

1. 从真实缺陷开始
为什么不是先造一个 Agent,而是先让 AI 进入真实 Debug
2. 从分析报告走向真实修复
如何让 Agent 进入仓库、修改代码并交付修复分支
3. 让失败成为下一轮输入
如何通过 Review、Action、Replay 与 Loop 持续校准方向
4. 证明缺陷真的被修好
修前复现、最小修复、修后用相同场景重新回证
5. 用数据证明阶段结果
准确率、替代就绪度与真实验证证据应该如何计算
6. 单兵小步快走的实践方法
本地优先、先定边界、最小改动,以及如何抓住真实数据窗口

听众收益:
1. 了解一个 AI-Native 工程项目从 0 到 1 的真实落地过程:如何先跑通最小闭环,再靠真实缺陷、真实记录和真实重跑持续改进。
2. 学到一套判断 AI 是否真的有效的方法:不只看单次输出,而是通过事后复盘、历史重跑和自动问题总结,判断系统有没有稳定变好。
3. 带走可复用的工程经验:包括如何让 AI 进入真实代码仓库、如何留下证据、如何处理测试阻塞、如何避免改错范围,以及如何在缺陷数量变多后减少人工复盘压力。
 
张琦
华为 研发大模型团队
研发智能体技术专家
华为 研发大模型团队 研发智能体技术专家 。主要负责AI研发助手CodeArts Snap的竞争力建设以及能力交付,端到端负责数据准备,模型训练,模型评测,服务交付。
待定
待定
Vibe Coding 最后一公里:华为生产级 Agent 效果调优实录
....
李佳奇
去哪儿旅行 技术总监 基础架构负责人
去哪儿旅行技术总监,基础架构负责人,技术中心TC委员、业务架构SIG负责人、腾讯云架构师同盟名人堂专家。10余年OTA一线研发经验,在高并发高可用系统建设、DDD项目落地、业务域系统价值度量、线上系统防腐治理、AI基建建设和项目落地等领域有代表性作品。多次在各大峰会等大会担任出品人和讲师。
待定
待定
从代码生成到可靠交付:天弦 Harness 的生产级 AI Coding 实践
1. AI Coding 进入生产级阶段
1.1 从“会写代码”走向“完成研发任务”
模型已经能完成代码生成、修改和问题分析,但真实研发还包含编译、测试、部署、日志、验证等完整链路。生产级 AI Coding 的目标正在从“生成代码”转向“完成交付”。
1.2 新瓶颈从模型转向研发基础设施
当 AI 执行速度越来越快,环境准备、工具调用、部署、日志获取和反馈链路开始成为新的效率瓶颈。企业需要重新设计面向 Agent 的研发基础设施。
2. 天弦 Harness:为 Coding Agent 构建生产级运行环境
2.1 模型负责推理,Harness 负责确定性执行
模型负责理解需求、分析问题和决定下一步动作;Harness 负责脚本、CLI、编译、测试、部署、日志和状态管理,把不确定推理与确定性执行分开。
2.2 从一次生成变成持续执行 Loop
通过“理解 → 修改 → 执行 → 获取结果 → 分析 → 修复 → 再验证”,让 Agent 持续从真实研发环境获取反馈,直到满足完成条件。
2.3 用工程证据定义“真正完成”
代码生成不代表任务完成。天弦通过编译结果、测试结果、部署状态、运行日志和最终验证形成 Evidence,决定任务是否可以结束。
3. 效率:重构面向 Agent 的研发基础设施
3.1 将 CLI / API 改造成 Agent-Friendly Tool
减少参数复杂度,统一输出格式和错误码,提高可重复执行能力,让 Agent 可以稳定调用,而不是依赖模型理解复杂人工操作方式。
3.2 缩短完整研发反馈 Loop
围绕环境创建、快速部署、日志获取和自动验证持续降低等待时间,优化的不只是模型响应速度,而是“修改到获得有效反馈”的完整周期。
3.3 确定性问题优先工程化
能通过脚本、规则、OpenRewrite 或自动化工具完成的动作,不交给模型临场发挥,把模型能力集中在真正需要理解和判断的问题上。
4. 质量与安全:让自主执行始终处于工程边界内
4.1 把质量验证嵌入 Agent Loop
通过编译、静态检查、自动化测试、Runtime 日志和业务验证,让每次修改都获得外部反馈,避免依赖模型自我判断。
4.2 Skills 从 Prompt 升级为运行契约
Skill 明确触发条件、输入、允许和禁止动作、执行脚本、输出格式、成功标准和失败处理,把研发经验变成可治理、可复用的工程资产。
4.3 自主能力越强,执行边界越重要
通过环境隔离、Sandbox、权限控制、超时、重试上限和人工接管机制,保证 Agent 可以自主探索,但不能无限执行。
5. 真实实践:
5.1 技术需求自动化实践:技术组件自动化升级
5.2 业务需求全流程实践:FERDQA职责融合的端到端交付
6. 总结
6.1 从出码率走向自动化水平和真实价值
除了人员覆盖率、需求覆盖率和出码率,还需要关注 AI 独立完成任务的程度,以及研发工时、交付周期和最终业务价值。
6.2 生产级 AI Coding 的 Harness 第一性原理
核心可以归纳为:控制环境而不是依赖模型自律;模型负责推理、工程系统负责确定性;状态存在于模型之外;完成必须有 Evidence;Agent 可以发散,但 Runtime 必须收敛。
6.3  从 Coding Agent 走向真正的研发生产系统
未来竞争重点将逐渐从“谁的模型更会写代码”,转向“谁能让 AI 更深入、更可靠地进入真实研发环境并完成端到端交付”。
程娜
前程无忧 用户端测试负责人
前程无忧(51job)用户端测试负责人,负责用户端质量保障工作,长期参与复杂业务场景下的功能测试、数据验证和测试工程实践。
在埋点测试平台建设过程中,尝试将 Claude、Codex 等 AI Coding 工具应用于需求分析、方案设计、代码实现、测试补充和问题定位等研发环节。围绕 AI Coding 场景下出现的“假通过”问题,结合实际项目实践,逐步沉淀出一套以规则定义、独立审查和真实数据验证为核心的行之有效的质量保障模型和落地实践。
擅长复杂业务场景下的测试设计、埋点数据验证以及研发协作过程中的质量风险识别与防控,持续探索 AI 工具在测试工程和质量保障领域的应用实践。
待定
待定
从代码生成到可信交付:AI Coding“假通过”的识别与防控实践
议题背景:
在复杂业务系统建设过程中,AI Coding 开始逐步融入研发流程,改变了需求分析、方案设计、代码实现、测试补充和问题修复等环节的协作方式。但随着 AI 深度参与研发流程,一个新的问题也逐渐显现:代码实现速度提升后,如何保证业务结果真正正确。

我司在建设埋点测试平台的过程中,尝试将 Claude、Codex 等 AI Coding 工具应用于研发与测试协作。平台能力逐步完善的同时,也暴露出新的质量挑战:部分问题并不是代码无法运行,而是系统没有报错、流程显示成功,最终业务结论却可能并不正确。

这类问题可概括为“假通过(False Pass)”:由于业务规则理解、查询边界、用例执行完整性或数据验证不足,系统可能给出看似合理、但无法支撑验收的结论;更严重的是,验证体系自身也可能在没有显性报错的情况下失效。

这让我们意识到,AI Coding 带来的不仅是开发方式变化,更要求重新定义“正确”如何被验证,以及“通过”如何被证明。

本次分享将结合埋点测试平台建设实践,复盘“假通过”的产生原因与治理过程,并介绍体系从 AI 自查 → 交叉审核 → 规则校验 → 资产沉淀 → 多 AI 并行可信测试 的演进路径:统一任务包驱动多条独立执行链路,需求解析、用例生成、测试执行、结果比对四个环节固定运行;再以真实执行记录、规则命中和置信度四维完成结论评判与决策路由,推动 AI Coding 从代码生成走向可信交付。

内容大纲:
1. 真实风险:AI Coding 时代,“正确”正在变得难以证明
1.1 提效之后,验证成为新的主要投入
AI 可以快速参与需求分析、方案设计、编码、测试与修复,但生成速度提升并不直接等于交付质量提升;
关键风险不在于系统是否运行,而在于业务结论是否真正成立;
当 AI 报告任务已通过时,仍需要回答:执行了什么、范围是否正确、证据在哪里。
1.2 两个典型案例:错误如何隐藏在“成功”里
案例一「查询范围静默失控」:查询条件解析异常后未触发报错,系统在错误范围内完成执行,验收报告却看似正常;
案例二「验证体系自身的假通过」:部分测试未被完整收集和执行,报告仍显示全绿;
两类问题共同说明:任务完成、报告生成和通过率结果,都只是信号,不是结论证据。
1.3 为什么“假通过”比报错更危险:问题的复杂性
它不一定抛异常,也不一定留下明确错误日志;
埋点验收同时受事件、属性、终端、业务线、时间窗口等多维规则影响,局部偏差可能生成看似合理的错误结果;
AI 的实现与验证若处于同一推理链,容易持续强化同一组假设,放大验证盲区。
2. 破解“假通过”:从单点修复到系统化防控的四轮演进
2.1 第一轮:人工复查与 AI 自查,很快失效
让 AI 对自己的结果进行复查,仍可能沿用相同假设;
人工逐条核对能够发现问题,但难以支撑持续规模化运行;
结论是:同一推理链内部,难以稳定发现自身的假设错误。
2.2 第二轮:实现与审查分离,双 AI 独立审查
由不同 AI 分别承担实现与审查职责,审查侧负责提出反例、挑战边界、补充问题项;
人工确认审查发现,避免将审查结论直接作为最终事实;
独立审查可以增加发现问题的机会,但其结论同样需要经过证据验证。
2.3 第三轮:规则校验,把问题判断转化为系统约束
将事故中暴露的判断条件固化为可执行规则,而不是依赖后续人工记忆;
规则在需求解析、用例生成和结果比对等阶段介入,补齐遗漏场景并约束判定结果;
命中规则后保留处理记录,使问题判断可检查、可回放。
2.4 第四轮:把每个问题变成资产,防复发体系
将问题固化为规则、黄金用例、回归 E2E、验收口径和项目经验;
规则与用例随项目持续演进,成为后续任务默认生效的约束;
不仅修复当前问题,更降低同类问题再次发生的概率。
3. 方法沉淀:一套可复制的多 AI 并行可信测试体系
3.1 任务层:统一任务包与上下文隔离
将需求、验收口径、规则与执行约束统一封装为任务包;
多条 AI 执行链路并行处理同一任务,但不共享中间结论;
通过上下文隔离与不合规链路剔除,避免单一推理路径主导最终判断。
3.2 执行层:需求解析、用例生成、测试执行、结果比对
需求解析:将需求文本转化为可验证的需求清单与验收断言;
用例生成:围绕需求清单生成测试场景,并补齐规则要求的覆盖项;
测试执行:以真实执行结果作为判定输入,保留执行过程与结果记录;
结果比对:逐项对照验收口径,并归并为需求级结论。
3.3 规则层:规则注入、命中留档与过程可回放
规则不只是文档要求,而是参与任务执行的可配置约束;
在用例生成和结果比对阶段自动注入、校验并记录命中结果
规则版本、命中过程与处理结果可追溯,为后续复核提供依据。
3.4 评判层:置信度、规则命中与决策路由
以一致性、覆盖度、执行质量、证据完整度构成置信度评判;
底线规则处理不可接受的高风险情形,阈值规则约束自动通过的最低条件;
最终输出自动通过、人工审核或人工介入,使不同风险等级进入对应处理路径。
4. 落地验证:从体系设计到平台运行
4.1 运行成效:执行规模、规则覆盖与验收效率
基于实际需求验收,展示执行链路、用例覆盖、规则覆盖、耗时与成本等运行指标;
验证多链并行、统一任务包与固定执行流程在持续验收场景下的可运行性;
评估从任务输入到验收结论的整体效率。
4.2 决策成效:多链对比、结论评判与分级处置
对多条执行链路的结论进行一致性、覆盖度、执行质量与证据完整度评判;
结合规则命中情况,识别结论分歧、覆盖缺口与高风险事项;
按自动通过、人工审核、人工介入三类路径完成分级处置与结果留痕。
4.3 质量成效:问题发现、规则补强与回归验证
对运行中发现的问题进行分级管理,并形成规则预设与人工确认闭环;
将典型问题补充为规则与回归 E2E,验证修复结果并防止同类问题复发;
通过规则、用例与执行记录的持续积累,提升验证体系的稳定性与可维护性。
4.4 复用成效:规则资产与评判能力跨场景应用
将已沉淀的规则、用例和评判口径复用至其他测试平台与业务场景;
在不同测试对象之间保持任务输入、规则表达和结论判断的一致性;
持续扩大验证范围,降低重复人工核验成本。

听众收益:
1.识别复杂业务场景下 AI Coding“假通过”的典型模式,避开“系统正常运行 = 结果正确”的认知陷阱;
2.获得一套经过真实平台运行验证的防控方法:交叉审核 → 规则校验 → 资产沉淀 → 多链独立执行与证据评判,可迁移至自身项目;
3.理解 AI Coding 从个人提效走向团队级可信交付所需的工程能力,包括统一任务、规则约束、过程留痕与分级决策。
刘焱
叮咚买菜 基础技术 研究员
前阿里本地生活资深架构师,技术风险部负责人,负责全站系统稳定性、 技术风险、后期负责核心基础设施团队,经历多次双11、全站搬迁、全链路压测等任务。

当前叮咚买菜基础技术研究员,为基础技术、IT基础设施、信息安全等领域负责人,负责全站系统稳定性、基础架构、中间件、数据库等,完成多云多活升级。近期接手Ai Coding下的质量体系建设。
待定
待定
AI Coding 质效保障实战:
叮咚买菜的流程协同、门禁重构与基建补齐
议题背景:
叮咚买菜产品技术研发接近千人规模,在AI Coding/AI工程化的情况下,如何保障产品技术研发质量、发布效率、以及线上稳定性的一系列实践。

痛点:
1. AI coding对研发流程的冲击,code可读性、架构稳定性、代码复杂度等快速膨胀
2. Ai coding对组织形式的冲击,支持全栈化工程的基础能力缺失,导致AI coding提效迅速,需求吞吐进展缓慢
3. AI coding对系统架构的冲击, 应用场景Agent化需求快速增加,Agent infra基建没有及时跟上。
 
思路:
1. 研发流程和组织配合Ai Coding进展协同迭代:迭代过程中前端、测试、后端、研发、SRE等分别演进路径
2. 研发流程中不变部分重构:质量门禁和发布门禁。 技术难点:Agent长程任务稳定性、用户体验和Token用量优化、知识库构建和迭代、流水线支持“红军”链路等
3. 无自研大模型的中小研发团队的可靠性基建:通过构建Agent runtime,支持不同场景下的Agent运行范式完成Agent infra的建设。

内容大纲:
叮咚买菜AI质量实践概述
叮咚买菜千人规模研发团队在AI Coding与AI工程化浪潮下,面临研发流程、组织形式、系统架构三重冲击:代码复杂度与可读性问题快速膨胀、全栈化工程基础能力缺失导致需求吞吐进展缓慢、Agent化场景激增而基础设施滞后。团队以"流程协同迭代—不变部分重构—Agent基建补齐"三位一体路径破局:推动前端、测试、后端、研发、SRE等角色协同演进,重构质量门禁与发布门禁,并通过构建Agent runtime支撑不同场景下的Agent运行范式。过程中重点攻克Agent长程任务稳定性、用户体验与Token用量优化、知识库构建迭代、流水线"红军"链路等技术难点,为无自研大模型的中小研发团队提供了一套可复用的可靠性基建实践范式。

AI质量实践 | 叮咚买菜AI Coding下的研发质效保障
1. 背景与挑战
1.1 叮咚买菜研发规模与AI工程化现状
1.1.1 千人规模研发团队的AI Coding背景(先实践再调整)
1.1.2 重新校准成本、效率、稳定性的目标(需求吞吐率、每token收益、冒烟率)
2. 三大痛点剖析(一)
2.1 AI Coding对研发流程的冲击
2.1.1 代码可读性、架构稳定性、代码复杂度快速膨胀
2.1.2 测试能力流失、线上验证能力流失
3. 三大痛点剖析(二)
3.1 AI Coding对组织形式的冲击
3.1.1 全栈化工程基础能力缺失
3.1.2 个体提效迅速但需求吞吐进展缓慢
4. 三大痛点剖析(三)
4.1 AI Coding对系统架构的冲击
4.1.1 Agent化需求快速增加,但Infra基建未及时跟上
4.1.2 架构焦点从高并发转到长程任务
5. 解决思路总览
5.1 "流程协同—门禁重构—基建补齐"三位一体破局框架
6. 解决方案一:研发流程与组织协同迭代
6.1 多角色协同演进路径
6.1.1 前端、测试、后端、研发、SRE分别演进路径
7. 解决方案二:研发流程不变部分重构
7.1 质量门禁体系:测试数据构建、测试环境稳定性、流量回放能力、E2E AI测试能力等
7.2 发布门禁体系:校验清单、预案执行、变更分析等
8. 关键技术难点攻关(一)
8.1 Agent长程任务稳定性
8.2 用户体验与Token用量优化
9. 关键技术难点攻关(二)
9.1 知识库构建与迭代
9.2 流水线支持"红军"链路
10. 解决方案三:Agent infra建设
10.1 Agent runtime构建
 - 支撑不同场景下的Agent运行范式
11. 中小团队可靠性基建实践
11.1 无自研大模型团队的基建路径
 - 对标行业Agent质量保障与评测体系
12. 实践成效与价值
12.1 质量、效率、稳定性数据对比
13. 经验总结与未来展望
13.1 AI质效实践的核心原则总结

听众收益:
1. 跳出"AI出码率即提效"的认知误区,获得千人规模团队在AI Coding冲击研发流程、组织形式、系统架构三重挑战下的"流程协同—门禁重构—基建补齐"系统化破局方法,可直接作为制定本组织AI质效战略的参照系。
2. 拿到Agent长程任务稳定性、Token用量优化、知识库构建迭代、流水线"红军"链路等关键技术难点的工程化解法,以及质量门禁与发布门禁重构的可落地清单,缩短自身团队的踩坑周期。
3. 掌握一套不依赖自研大模型、通过构建Agent runtime支撑多场景Agent运行范式的可靠性基建路径,为中小研发团队提供经过实战验证、可直接对标的实践模板。

关注QECon公众号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
135-2067-8913  媛媛
媒体合作
135-1619-6409  皮皮
添加QECon小助手,获取
会议最新资讯
购票咨询
13520678913  媛媛
服务总线
400-183-9980  
电话咨询
联系电话:
翟国娟 15901265561