专场:从 Vibe Coding 到 Agentic Engineering:AI 研发范式跃迁
代码正在成为一种近乎无限的生产力。真正稀缺的,不再是写代码的能力,而是定义正确目标、构建有效约束,并让 Agent 把事情真正做成。本专场将从 Vibe Coding 出发,走向 Agentic Engineering,探讨 Spec、Loop、Harness 与 Agent Workspace 如何重塑软件研发,让 Agent 不只是生成代码,而是持续理解、执行、验证并交付结果。软件开发的下一个时代,不是人写得更快,而是人与 Agent 一起创造过去无法完成的产品。
专场出品人:陈鑫
阿里巴巴资深技术专家 Qoder IDE Agent 技术负责人
带领团队积极探索 Coding Agent 能力的上限,在上下文工程、智能体架构、AI Coding企业落地等方面有丰富一线实践经验。
赵金霞
中兴通讯 高级软件开发工程师
中兴通讯有线研究院驱动软件开发工程师,拥有近20年通信行业软件研发经验,长期专注于光传输领域底层驱动与系统软件的设计与开发,深耕波分复用设备的驱动架构优化、高性能数据传输机制及软硬件协同设计,在高速光模块控制、低时延驱动开发及系统稳定性提升方面具备深厚技术积累。主导并参与多个重点波分产品项目的驱动层研发,具备丰富的大型项目实战经验,擅长嵌入式系统开发、Linux内核驱动调试及跨团队技术协同,致力于推动光网络设备的高可靠与智能化演进。
待定
待定
大模型驱动的嵌入式系统 AI Coding 实践:
从知识工程到数字孪生的全链路提效
议题背景:
在大型通信、工业控制、自动驾驶等复杂系统中,嵌入式软件普遍面临硬件依赖强、环境搭建难、开发效率低、测试覆盖不足等共性挑战。传统开发模式高度依赖物理设备,导致环境复用率低、迭代周期长、人力成本高。尤其在系统升级、故障演练、新功能验证等关键环节,缺乏高保真的虚拟化测试手段,风险难以预控。
随着大模型技术的发展,如何将存量代码、设计文档、运维经验等非结构化知识转化为可执行的AI生成能力,构建“知识驱动+AI生成+仿真验证”的新型研发范式,成为突破嵌入式系统开发瓶颈的关键。本议题以真实大型嵌入式系统为背景,分享大模型在软硬件协同开发中的AI Coding落地路径,探索从知识沉淀到自动化验证的全链路提效实践。

内容大纲:

1. 现实挑战:复杂系统开发为何陷入瓶颈?
1.1 硬件依赖严重:开发测试强依赖物理设备,资源紧张、成本高昂
1.2 建模效率低:系统建模靠人工,重复劳动多,错误率高
1.3 验证覆盖不足:真实场景难以穷举,升级上线风险不可控
1.4 软硬协同难:软件开发滞后于硬件交付,联调周期长
典型场景:缺乏“预演沙箱”,系统变更如同“盲人过河”

2. 解决思路:构建“AI驱动的可执行数字孪生体”
提出三层融合架构:
1)知识工程层:沉淀存量代码、文档、接口契约,形成结构化领域知识
2)AI生成层:大模型理解语义,自动生成代码、配置、测试脚本
3)仿真系统层:构建可运行的虚拟环境,支持行为模拟与自动化验证
目标:让每个物理系统都有一个可编程、可并行、可预演的“数字孪生体”
3. 落地实践:AI Coding如何嵌入嵌入式开发全流程?
3.1 知识结构化:打造高质量AI训练底座
3.1.1 自动提取代码依赖、模块接口、状态机逻辑
3.1.2 构建“模型描述语言”(MDL),统一建模语义
3.1.3 支持AI生成新设备代码(生成率80%+,采纳率90%+)
3.2 组装式开发:系统即代码,硬件可组装
3.2.1 抽象层级:系统 → 设备 → 模块 → 接口
3.2.2 自顶向下分解 + 自下向上组合,支持快速建模与替换
3.3 AI优化核心算法设计
3.3.1 传统路径搜索存在重复计算问题
3.3.2 利用大模型进行图结构抽象,输出动态规划优化方案
3.3.3 算路效率显著提升,适用于大规模组网场景
3.4 AI生成工具链,实现全流程自动化
工具        功能        提效成果
(1) TopoGen        拓扑转命令行        环境搭建效率↑80%,出错率↓90%
(2) PathTracer        信号流追踪        故障定位提效90%+
(3) StubGen        接口桩生成        减少重复编码,统一风格
(4) TestFlow        测试用例部署        支持20+并行验证泳道
✅ 实现“一键搭建仿真环境”“黑灯自动化测试”
4. 成效验证:降本、增效、提质闭环
4.1 成本:节省硬件投入超千万元,95%仿真运行于虚拟资源池
4.2 效率:单板建模从5人天→1人天,环境部署时间缩短50%+
4.3 质量:累计拦截缺陷177项,测试覆盖率从12.65%→99.59%
4.4 安全:实现“先在虚拟世界升级1000次,再在真实网络升级1次”
5. 方法论沉淀:可复制的AI工程化范式
[结构化知识] → [AI生成能力] → [可运行仿真体] → [自动化验证闭环]
可推广场景:
1)工业控制系统仿真
2)智能汽车ECU开发
3)航空航天嵌入式系统
4)物联网设备联合调试
未来方向:
1)向芯片级仿真、全链路性能预测演进
2)融入CI/CD,实现DevOps + AI + 数字孪生一体化
3)探索多智能体协作开发模式
周吕
腾讯 IEG 用户增值部 Tech Lead
现任腾讯 IEG 用户增值部 Tech Lead,从业 12 年,专注 服务端研发 / 云原生 / AI Infra / 研发效能与复杂工程系统建设。
工作 12 年,接触了多个项目,从 高性能 到 云原生,从 研发效能 到 AI Infra,从 百万QPS 服务到 Agent 框架等,相关领域都有涉及,曾主导了 IEG 营销活动平台,Serverless等多个平台建设,目前负责推动部门 AI Native 工作方式转型,构建 Agent 等多个基础建设,将一些 AI 工具改造为可验证、可评估、可复用、可迭代的组织流程,并形成“基建支撑场景、场景沉淀经验、经验进化基建”的闭环。
擅长领域:企业 AI Infra、Agentic Engineering、AI Native 流程治理、研发效能度量、运行时与性能工程。
待定
待定
做了 100 个 Agent,为什么效率没有改变?
——企业大脑与 AI Native 流程闭环实践 
议题背景:
企业 AI 建设正在从"员工会不会用 AI"进入"AI 能否改变组织工作方式"的深水区。多数企业转型失败并非模型不够强,而是只购买模型和工具,却没有重构业务、数据、责任与组织。现实中,很多团队已创建几十甚至数百个 Agent,但业务流程、成功标准和组织知识并未改变,工具数量没有转化为业务价值。
本议题基于部门 AI Native 改造与 AI Infra 建设实践,分享一条组织级落地路径:从Vibe Coding 谈起,先梳理当前流程、画出现状与预期两张流程图,用节点契约卡定义输入输出与完成判据,将节点映射为 Agent、Skill、Workflow、MCP 与知识库;以五层基建承载企业大脑,并结合工程实践;用三层验证确认流程是否真正运行,并把执行指标、失败样本和人工纠偏持续沉淀回企业大脑。
最终形成"企业大脑提供能力—Agent 执行业务—反馈持续沉淀—重构优化企业大脑"的正向循环,使 AI Native 从工具试用升级为可验证、可评估、可复用、可迭代的组织工程。

内容大纲:
1. 为什么做了 100 个 Agent,组织仍没有改变
1.1 Vibe Coding:创造民主化的胜利,组织效能为何没有跟进
1.2 企业 AI 的三大虚荣指标:用户数、Agent 数、Token 数——衡量的是消费,不是生产
1.3 三层组织焦虑与转型根因:只买模型和工具,没有重构业务、数据、责任与组织
1.4 个人创作与组织转型的同构缺口:契约、验证、沉淀、学习尚未组织化
2. 从个人提效到组织工作流重构
2.1 四个阶段:工具使用 → 能力复用 → 流程改造 → 组织学习(可局部并行试点,不可跳过验证直接规模化)
2.2 Agentic Engineering 的组织级定义:将业务目标拆成可执行、可验证、可学习的流程节点网络
2.3 企业大脑不是更大的知识库,而是知识、记忆、能力、标准、反馈共同组成的决策与执行中枢;分水岭是能否根据运行反馈自我进化
2.4 人的位置:AI 承担更多执行,人保持作者性——每个 AI 节点的 DRI 责任制
3. 第一步不是做 Agent,而是画出两张流程图
3.1 第一张图 As-Is:画出"活的"流程,标记等待、返工、重复、断层四类摩擦点
3.2 第二张图 To-Be:不是"旧流程+AI",而是按今天的条件从零重画
3.3 节点契约卡:输入、输出、完成判据、失败处理、DRI 与预算
3.4 五种构件选型:Workflow / Skill / MCP / Agent / 知识库——确定性优先于智能性
3.5 组织版强化学习:π₀ → π* 的策略迭代,流程图是版本化的活资产
4. 构建企业大脑的五层基建
4.1 知识与记忆层:知识库 + TeamMemory,唤醒沉睡数据并保留决策原因
4.2 可复用能力层:Skill / Workflow / MCP / Agent / CLI 能力套件;能力"发布一次、全员复用"
4.3 编排执行层:Claude Agent SDK × OpenAI Agents SDK 双引擎,Workflow 轨道、长短任务与统一测试
4.4 验证治理层:Harness 四体系落地——四类评测、全链路留痕、六级可见性、安全与成本治理
4.5 反馈进化层:安装、使用、Token、执行结果遥测,相似度检测、人工纠偏与淘汰机制
4.6 多模型底座与大厂工程共识:Claude / OpenAI / Google / DeepSeek 分工路由,六个稳定工程问题(Context / Tools / Orchestration / Tracing / Evals / Governance)
4.7 三笔实战学费:上下文污染、能力通胀、成本失控
5. 验证与进化:让业务场景构建企业大脑
5.1 三层验证:节点对不对、流程跑没跑、业务值不值——上线 ≠ 运行
5.2 四类反馈:结果、过程、人工纠偏、组织标准——场景是大脑的训练数据生产者
5.3 成功沉淀链:一次成功 → Skill → Workflow → 部门标准流程
5.4 失败沉淀链:重复失败 → 工具约束 / 门禁 / 反例 / 评测集
5.5 企业大脑飞轮:Map → Design → Run → Evaluate → Learn → Evolve
5.6 复利指标:能力复用率、标准化率、纠偏转规则周期、新场景接入周期

听众收益:

1. 一张可对照的转型地图:用四阶段自查表定位自己的组织,看清"个人提效"与"组织效能"之间的缺口在哪里。
2. 一套可直接落地的方法:两张流程图画法、节点契约卡模板、五种构件选型原则,本周即可在一条真实流程上试点。
3. 一份大厂工程实践参照:生产级 Agent 的六个稳定工程问题与五层基建架构,以及上下文污染、能力通胀、成本失控三类典型踩坑的对策。
4. 一组替代虚荣指标的复利指标:能力复用率、标准化率、纠偏转规则周期、新场景接入周期,让转型成效可衡量、可汇报。
企业 AI 转型的分水岭,不是拥有多少 Agent,而是每一次 Agent 执行,是否都让企业大脑比上一次更懂业务、更会执行、更能判断对错。

姜子玥
阿里巴巴  QoderCLI 技术专家
.....
待定
待定
QoderCLI 一天一版背后的 Agentic Engineering:
产品持续演进的 Agent 自闭环实践
....
蔡明师
腾讯 TEG网络平台部 运营开发工程师
现任腾讯TEG网络平台部运营开发工程师,曾参与自研BPMN Workflow平台底层核心模块设计与开发,并先后负责流程端到端测试平台、智能体Agent开发与应用平台、网络工程师训练平台等内部关键系统的设计与开发,正致力于打造智能化的全球网络运营体系。

持续的输入才能有效地输出,目前对 AI DevOps, TDD、Workflow、Agent 以及构建 AI 原生研发体系有较深实践,同时持续跟进学术界和工业界在 AI 研究与应用领域的进展。
待定
待定
从 Vibe Coding 到 AI 原生研发体系:一套可落地的工程实践
议题背景:
行业现状:
AI Coding 在个人场景已证明提效价值,但进入企业真实研发后,核心问题不再是"能否生成代码",而是如何在真实仓库、真实流程、真实质量要求下稳定交付,并让团队中非开发角色也能参与。

我们遇到的真实痛点:
Vibe Coding 的"玩具困境":运营同事各自用 AI 写页面,重复造轮子、数据不互通、鉴权口径不一、页面风格五花八门,时间一长沦为"历史遗产"。
"想做点正事"拦路虎太多:系统接口权限申请、文档不全、字段含义不清、鉴权方式各异,AI 没有上下文时大量 token 烧在排查基础设施问题上,效率极低。
AI 高频提交下代码腐化加速:传统团队半年才显现的代码腐化,AI 高频提交下一两周就出现,靠人定期 review 不可持续。
非开发者参与门槛高:运营同事想提需求,却不懂"侧边栏""面包屑"这类产品语言,也不了解系统已具备什么能力,沟通损耗大。

思考方向:
与其追求把 AI 能力上限推得更高(全自动 loop),不如先搭好一套企业级工程底座 + Harness 护栏,让 AI 守住质量下限、提高 token 效率,同时把研发参与门槛降到足够低,让整个团队(含非开发)都能参与建设——即"AI 原生的研发&运营团队"。

内容大纲:
1. 开场
1.1 自我介绍与项目背景:海外网络运营平台 Vibe Flowing
1.2 一个问题切入:个人用 AI 写代码挺爽,团队真实场景为什么搞不动?
1.3 本次分享的主线:从玩具到企业级,再到 AI 原生研发团队
2. 问题在哪——Vibe Coding 的"玩具困境"
2.1 重复造轮子、数据不互通、只有自己说得清
2.1.1 各自调用后端接口、鉴权口径不一、数据散落孤岛
2.1.2 "超链接聚合页"沦为草台班子
2.2 想正经做点事,拦路虎太多
2.2.1 接口权限申请、文档不全、字段不清、AI 排查烧 token
2.2.2 底层复杂性远超业务逻辑,AI 没上下文难以高效定位
2.3 核心反思:缺的不是 AI 能力,而是一个专业开发先搭好的架子
2.3.1 出发点:先搭企业级底座,再让 AI 在上面持续开发
3.效果概览——AI 原生研发长什么样
3.1 场景一:AI 原生的研发整体流程(实战演示)
3.1.1 运营同事从 anydev 模板创建容器 → 与 AI 对齐需求 → AI 全栈开发并自测 → 推送 MR → 审批合并
3.1.2 演示:运营同事不写一行代码、不碰 git,完成一个"出口流量按 AS 聚合桑基图"功能
3.2 场景二:AI 原生的 Agent 开发流程(实战演示)
3.2.1 给 AI 一个业务目标 → AI 探索代码仓库 → 写提示词/工具/注册 → 端到端验证 → 网页直接可用
3.2.2演示:从一句话需求到一个可用的"专线质量分析 Agent"
3.3 小结:人只管定义"要什么",AI 负责"怎么做"
4. 从玩具到企业级——基础设施建设
4.1 对接内部业务 SDK
4.1.1 Python 3.12 升级、submodule 集成、AI 自行探索接口能力
4.2 通用底层能力沉淀
4.2.1 日志、RBAC 权限、访问审计、开放 API、MCP 工具、定时任务(@cron_job 装饰器)、工作流(Durable Function)
4.2.2 设计理念:小平台内置这些能力,AI 能帮搞定,不必跨系统交互
4.3 Anydev 统一研发环境
4.3.1 7 步自动化初始化脚本:上报环境 → 系统依赖 → 工具链 → 注入规范 → 渲染 private.env → 装依赖 → 启动服务
4.3.2 3 分钟零人工介入,任何同事打开就能用
4.3.3 关键设计:每步独立可单独执行、失败即停原因清晰、幂等可重跑
5.Harness 工程实践——给 AI 立规矩、装技能
5.1 大仓组织形式
5.1.1 monorepo 前后端同仓、严格分层(controllers→services→models→source)、_framework/ 脚手架
5.1.2 前端组件化:SFC 500 行内、智能组件+展示组件、143 个 Storybook story
5.2 用 Rules 和 Skills 给 AI 立规矩、装技能
5.2.1 三层 Rules:AGENTS.md(工程规范)+ anydev_rule(流程约束+用户保护)+ Memory(项目记忆)
5.2.2 Skills 技能包:Agent 创建、工作流、Changelog、前端设计、Vue 开发、工蜂、iWiki
5.2.3 关系:Rules 保底线(不犯错),Skills 提效率(干活快)
5.2.4 演示:anydev_rule 四条铁律 + AI 完成开发后交人验证的效果
5.3 TDD 实践与取舍
5.3.1 后端 pytest、前端 vitest + Playwright E2E
5.3.2 静态检查兜底:ruff + ty / oxlint + vue-tsc
5.3.3 取舍:核心逻辑必须有后端单测,E2E 覆盖关键流程,覆盖率 70% 作参考不阻断
5.3.4 更看重"验收"而非"测试"
5.4 轻量 SDD(规格驱动开发)
5.4.1 极简文件命名约定实现工作流:draft_ → ready_ → done/
5.4.2 文档命名约定就是工作流,不用额外项目管理工具
5.5 封装 CLI 工具
5.5.1 flow-db-exec(DB 变更唯一入口,高危拦截+留痕+dry-run)
5.5.2 flow-config(业务配置管理,轻量透明 AI 友好)
5.5.3 run-cron(定时任务独立进程)
5.5.4 理念:高频运营操作封装成"安全、留痕、可重复"的命令
5.6 让 AI 看见问题(四层质量反馈)
5.6.1 静态检查即反馈 → AGENTS.md 汇总规则 → 开发服务 AI 自主管理 → Playwright 验证
5.7 DB 变更管控
5.7.1 极简(一个入口)、透明(changelog.sql 留痕)、可验证(按风险分级处理)
5.7.2 时间字段统一 DATETIME,禁止 BIGINT 时间戳
5.8 Agent 工作流:AI 原生的 Agent 研发方式
5.8.1 传统"平台+后台配置" vs 我们的"代码即配置"
5.8.2 ReactAgent 基类 + 注册机制,AI 端到端完成 Agent 创建
5.8.3 设计细节:SSE 流式断连重连、工具返回 markdown 省 token
5.8.4 演示:Agent 创建 Skill 部分内容
6. AI 驱动的代码去腐化
6.1 问题:AI 高频提交下代码腐化加速,一两周就显现
6.2 code-rot-scan:定期体检 + 建 issue
6.2.1 静态工具优先(ruff/ty/oxlint/vue-tsc/pytest)+ 自定义结构性腐化检测
6.2.2 产出按严重度分组的 Markdown 报告,精确到文件路径+行号
6.2.3 批量工蜂建 issue,1~3 小时能修完的小颗粒度
6.3 code-rot-fix:强 TDD 修复 + 闭环关单
6.3.1 7 步流程:拉 issue → 评估测试 → 盘活测试 → 实施修复 → 全套验证 → 评论关单 → 提交
6.3.2 多 worktree 并行修复,一轮处理 4~5 个 issue
6.4 为什么有效:高频小批量 + 闭环可追溯
7. 开发与产品协同
7.1 页面评论到自主开发
7.1.1 页面级评论系统(记录路径/元素定位/截图)→ 评论状态流转 → 复杂需求走 SDD
7.1.2 开发容器自助注册,运营同事提前验收
7.1.3 核心价值:需求提报门槛降到最低
7.2 给非开发者一张"能力地图"
7.2.1 结构化文档把功能模块/Agent/定时任务/API 按业务域分类
7.2.2 AI 几分钟生成,运营同事读一遍后提需求更"有的放矢"
8. Lessons from AI Coding
8.1 避免廉价习得感
8.1.1 "我也会编程"的错觉是危险的
8.1.2 运营同事需学习基本开发术语(分层架构、ORM、中间件、SSE),才能给出有质量的反馈
8.2 省 token 的工程实践
8.2.1 AGENTS.md 集中规则、工具返回 markdown、CLI 替代临时脚本、大仓+语义搜索、SDD 文档驱动、组件化+Storybook
8.2.2 RTK 等压缩工具的踩坑:偶尔出 bug、语义混淆,得不偿失
9. 总结与展望
9.1 三层事情归纳:基础设施 → 工程护栏 → 协作机制
9.2 正向循环:基础设施越好 → AI 产出质量越高 → 人审查负担越轻 → 人有更多精力优化基础设施
9.3 正在做的事:按这套方案为存量项目构建大仓、搭 Harness 骨架
9.4 方向:不是让 AI 替代人,而是搭好让 AI 和人都能高效发挥的体系,把团队带到"AI 原生的研发&运营团队"
9.5 Q&A

听众收益:
1. 拿到一套可复制的 Harness 工程落地清单:包括大仓分层约定、三层 Rules 体系(AGENTS.md + anydev_rule + Memory)、Skills 技能包、CLI 工具封装、DB 变更管控、TDD 取舍、SDD 文档驱动等具体做法,听众回去就能在自己的存量项目上落地,不必从零摸索。
2. 理解 AI 原生研发的组织协同新范式:不止是"开发用 AI 写代码",而是如何通过页面评论提需求、Anydev 统一研发环境、能力地图等机制,让产品/运营等非开发角色也能参与研发闭环,把"AI 提效"从个人层面上升到团队层面。
3. 掌握 AI 高频提交下的代码去腐化工程实践:听到一套"scan 只发现建 issue、fix 强 TDD 修复关单、多 worktree 并行"的闭环机制,以及 token 经济学(工具返回 markdown、渐进式披露、大仓语义搜索)等实战经验,解决"AI 写得快但代码烂得也快"的普遍焦虑。

李争鹏
群核科技  开发专家
10年互联网企业工程效率/稳定性领域工作经验,技术专家,长期工作在一线,专注于研发效能提升、敏捷与DevOps平台工程实践落地,目前聚焦 AI Native Dev、AI Coding 基础设施、研发工具链和 DevOps 服务治理。2026 H1 牵头推进公司级 AI Coding 工程化落地,覆盖 AI 编程工具选型、仓库级 AI 研发工作流、MCP / Skills 工具链、本地质量闭环、AI 代码评审治理、Code Agent 评测体系和研发效能数据分析。
待定
待定
生产级 AI Coding 实战:从个人提效到组织级交付闭环
议题背景:
AI Coding 在个人场景中已经证明了提效价值,但进入企业真实研发后,核心问题不再是“能否生成代码”,而是如何在真实仓库、真实流程和真实质量要求下稳定交付。我们在上半年推进公司级 AI Coding 落地时,重点建设了一套面向生产研发的工程底座:将需求澄清、任务边界、工程规范、项目上下文、质量检查、交付证据和效能度量纳入日常研发流程;同时通过 Harness Engineering,把本地启动、接口 / UI 测试、日志报告、失败修复和评测反馈组织成可执行闭环。实践中,AI 代码评审采纳率达到 70%+,核心工具调用量显著增长。分享将重点复盘从工具试用到组织级交付闭环的关键做法、踩坑经验和可复制路径。

内容大纲:
1. 从个人提效到生产交付:AI Coding 落地问题的变化
1.1 个人使用阶段的收益与局限  
AI IDE、命令行 Agent、Chat 工具已经能显著提升个人编码效率,但“写得快”不等于“交付稳”。当工具分散、上下文分散、经验只停留在个人习惯中时,团队协作、Review 和质量保障都会遇到新的问题。
1.2 企业真实研发中的核心挑战  
在真实仓库中,Agent 往往不了解工程规范、接口约定、测试方式和 Review 偏好;需求边界不清会导致大 diff、误改和返工;前后端、多仓库、需求系统、文档、MR、部署平台之间也会形成上下文断点。质量反馈如果仍然滞后在 CI、测试环境和人工 Review,Agent 很难快速迭代。
2. 仓库级 AI 研发工作流:让 Agent 按工程规则交付
2.1 把关键上下文沉淀到仓库  
将目录结构、接口格式、错误处理、权限校验、测试命令等工程规范沉淀到仓库;将目标、范围、out-of-scope、验收标准、风险点等任务上下文前置;将关键决策、验证结果、交付证据和复盘材料纳入过程记录。
2.2 任务分层与流程控制  
小问题快速处理,不引入重流程;普通需求先明确 PRD 和验收标准,再进入实现;复杂任务补充设计、实施计划、子任务拆分和风险控制;高质量模块引入 TDD 或强测试约束,先验证问题再修复。
2.3 实践踩坑  
不要一开始就追求全自动,应先稳定任务边界和验证路径;仓库规范不能靠“理想化文档”,必须从真实代码和 Review 反馈中沉淀;流程过重会降低采用率,需要按任务复杂度分层。
3. Harness Engineering:把质量反馈前置到 Agent 可执行的位置
3.1 环境、API 与 UI Harness 建设  
明确依赖安装、启动命令、环境变量、端口和健康检查,让 Agent 不只知道怎么启动,也知道什么叫启动成功;复用已有接口测试和 UI 自动化能力,明确测试入口、测试数据、报告路径、截图、trace、video 等调试产物,避免重复建设测试体系。
3.2 反馈 Harness 与本地质量闭环  
将日志、测试报告、失败用例和常见错误归因结构化,支持 Agent 基于失败结果继续定位、修复和重新验证。从“写完代码等人测”升级为“本地验证、读取反馈、自动修复、输出证据”。
3.3 企业交付链路适配  
串联需求来源、设计文档、历史方案、业务术语和规范文档;将 MR、commit、Review comment、变更说明纳入交付过程;接入测试环境创建、服务部署、探活和回归结果;处理前后端分离、多仓库和跨系统任务中的上下文断点。
4. 质量与效能度量:从试点推广到组织级复盘
4.1 质量与效能数据体系  
围绕模型用量、Token、成本、用户覆盖、MCP / Skill 调用量、任务完成量、工具链渗透率建立度量体系;同时将 MR 创建 / 更新、构建、部署、单测、静态扫描等指标纳入统一分析。实践中,AI 代码评审采纳率达到 70%+,构建成功率提升 3 个百分点以上。
4.2 Code Agent 评测体系  
基于真实 MR 构建私有评测集,使用需求描述作为 Agent 指令,在 base commit 上重新实现,以测试通过和行为正确性作为评分标准,而不是 diff 相似度。同时收集执行轨迹、Token 消耗、成本和失败类型,形成“数据 -> 评测 -> 优化”的闭环。
4.3 试点策略与组织级落地经验  
先选 1 个仓库、2-3 位开发者、3-5 个真实任务,优先选择风险可控、能本地验证、Review 反馈明确的任务,避开第一轮就做跨系统大改、强发布依赖和测试基础薄弱的任务。先让 Agent 稳定理解仓库,再追求复杂任务自动化;先跑通本地验证闭环,再谈大规模自治;先建立交付证据和数据度量,再评估 ROI。

听众收益:
1. 获得一套企业级 AI Coding 落地框架
听众可以了解如何从个人工具试用,推进到仓库级工作流、质量闭环、交付证据和效能度量,避免 AI Coding 停留在零散经验和个人技巧层面。
2. 掌握 Harness Engineering 的具体落地方法
分享会拆解本地启动、接口测试、UI 测试、日志报告、失败修复等 Harness 如何建设,以及如何让 Agent 从“生成代码”进一步变成“能验证、能修复、能交付”的研发协作者。
3. 获得可复用的试点与度量经验
听众可以参考我们的试点选择、任务分层、规范沉淀、评测集建设和数据指标设计,用更低风险的方式在自己的团队中推进 AI Coding,并用质量和效能数据判断真实收益。
关注QECon公众号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
135-2067-8913  媛媛
媒体合作
135-1619-6409  皮皮
添加QECon小助手,获取
会议最新资讯
购票咨询
13520678913  媛媛
服务总线
400-183-9980  
电话咨询
联系电话:
13520678913 媛媛