专场:AI 质量管控:从左移到右移的全链路实践 
随着AI编码工具的快速普及,生成代码已成为开发日常,但随之而来的幻觉、缺陷和安全隐患也越来越突出,传统的质量保证方式已明显跟不上节奏。 本专场探讨在AI时代,如何建立一套真正适配的全链路质量保障体系:从开发早期就做好针对AI代码的评审和幻觉检测,到引入适合AI原生应用的新型测试方法,再到利用智能工具加强安全扫描和生产阶段的持续监控,实现从左移预防到右移验证的完整闭环。结合当前行业面临的实际挑战与最新实践,分享如何在加快交付的同时,切实把控住代码质量和风险,帮助团队平稳完成向AI驱动开发的转型。
专场出品人:白路 
小红书 搜推广效率工程负责人
毕业于哈尔滨工业大学计算学部。先后就职于华为、百度,曾负责百度搜索、文心模型等核心产品的质效保障与稳定性能力建设,在引擎算法链路风险治理、研发效能提升、测试智能化及大模型效果评测等领域积累了丰富的实践经验。当前聚焦 Agent 驱动的智能变更管控与稳定性风险治理,探索 AI Native 时代的质效研发新范式。
李雁翎
微众银行 高级测试工程师
微众银行资深测试工程师,拥有8年软件质量保障经验。本科毕业于西安电子科技大学,硕士毕业于华中科技大学,具备扎实的计算机与工程理论基础。

曾先后就职于美团、字节跳动、Shopee及微众银行等头部互联网与金融科技企业,长期深耕金融支付、信贷核心、电商交易等业务领域,对高并发、高可用系统的质量保障有着丰富的实战积累。

在质量内建与测试左移方面,主导过多个业务线的流程优化与质量防控体系搭建,通过需求阶段介入、精准测试与持续集成实践,有效将缺陷发现左移,显著降低线上风险。在AI赋能测试提效方向,深入探索并落地了智能用例生成、流量回放、缺陷预测、回归策略优化等方案,在多个核心系统项目中取得了明显的质量与效率双提升,具备从方案设计到规模化落地的完整经验。

核心方向:测试左移、AI驱动测试提效、金融系统质量保障、质量效能提升
待定
待定
从需求到可执行脚本:测试知识库驱动的 AI 测试落地实践
议题背景:
AI 让开发写代码的速度指数级提升,但瓶颈转移到了验证代码——也就是测试。AI 生成测试场景和脚本看着像那么回事,但预期结果落不到真实的表名、字段名、错误码上,跑不通需人逐条调试。人审核本质是补上下文,但测试要考虑的远不止需求文档:功能完备性、关联方影响、灰度兼容、存量回归。很多人让 AI 总结一堆文档当知识库,正确性、结构、维护、用途没想清楚。正确思路是从问题倒推:先想清楚要解决什么问题才去建知识库。本议题分享从需求到可执行脚本的端到端落地实践。

内容大纲:
1. 背景痛点:AI 测试提效的瓶颈在哪 不够准需人补上下文;知识库被滥用(AI总结≠知识库);从问题倒推不为建而建。
2. 三类知识源互补:为什么缺一不可 代码知识库(系统有什么,编译期100%可信)、存量案例库(测过什么,执行过100%可信)、版本数据(改过什么)。少哪类 AI 就在哪瞎编。
3. 脚本化提取业务无关 先探测项目约定再13维度提取,只提取编译期确定的东西;换项目零改脚本。
4. LLM归纳策略原型 从案例行为指纹聚类"每类交易该怎么测",知识源注册表驱动按需加载。
5. 脑图生成四步法 存量三重兜底检索→七层叠加生成场景→五项自检→输出。
6. 脑图到脚本的鸿沟 映射JSON填补业务语言与代码语言:基建可自动匹配(接口/数据/断言/SQL)、业务语义需AI理解(前置步骤/Mock/状态推断/异步逻辑);契约对了脚本就能跑,人改契约不改代码。
7. 维护与落地 增量更新、消费者边界、换系统配置化。

听众收益:
1. 搞清楚瓶颈避开坑:不是AI不够强是缺上下文,从问题倒推而非为建而建
2. 带走可落地方法:三类知识源怎么提取怎么消费,换项目零改脚本
3. 看到端到端跑通:脑图到脚本的鸿沟怎么跨越,映射JSON让人改契约不改代码
焦海棠
岩山科技二三四五 高级测试工程师
岩山科技旗下2345网络科技高级测试工程师,深耕互联网质量管控领域十余年,在研发效能提升、业务质量赋能方面拥有丰富实践经验。长期专注于精准测试、研发效能与自动化体系建设,当前聚焦 AI 测试前沿方向,主导落地多项 AI 测试核心能力,推动质量平台智能化升级,自主规划并完整构建精准测试 1.0与 TIA 2.0 双版本技术体系。 擅长技术经验沉淀与赋能分享,获评公司年度最受欢迎分享嘉宾。
待定
待定
数据孤岛到追溯共识:
构建需求-代码-图谱三位一体的精准测试闭环
议题背景:
随着 AI 视频生成技术步入工业化落地阶段,传统的软件测试与纯端到端的大模型评估体系正面临前所未有的挑战:不仅存在掩盖致命语义错误的“高分补偿陷阱”,还面临大模型调用成本极高、响应时延过长以及规则难以维护的“不可能三角”。
- 核心定位:本议题针对 AI 视频生成(AI原生视频)场景,提出一套“漏斗式分层混合检测架构”。
- 架构特色:通过三层递进式过滤(基础画质拦截 → 多维特征门控 → 大模型深度仲裁),结合意图路由与特殊场景专用链路,系统性解决语义偏差、属性错配等核心质量问题。

内容大纲:
方案全景与核心结论
1)核心定位:本议题针对 AI 视频生成(AI原生视频)场景,提出一套“漏斗式分层混合检测架构”。
2)架构特色:通过三层递进式过滤(基础画质拦截 → 多维特征门控 → 大模型深度仲裁),结合意图路由与特殊场景专用链路,系统性解决语义偏差、属性错配等核心质量问题。

1. 背景与挑战:当 AI 原生视频走向工业化,质量体系面临哪些严峻挑战?
1.1 业务视角的质量痛点
1.1 现象:大模型生成的视频越来越惊艳,但为什么用户还在频繁反馈问题?
1.2 具体缺陷表现:语义与主体偏差(跑题/关键主体缺失)、属性与空间错配(数量/性别/穿搭不符,位置错乱)、时序与动作失真(违背常识与叙事逻辑)。
1.2 传统 QA 体系为何面临瓶颈?
1.2.1 用例爆炸与漂移:传统硬编码测试规则难以穷举;端到端大模型评估又存在决策漂移。
1.2.2 缺乏标准答案(No-Reference):导致质量体系面临“可解释性、评估成本与准确率”的“不可能三角”。
1.3 核心陷阱深度剖析:“高分补偿”带来的业务风险
1.3.1 场景还原:Prompt 要求“一位红色连衣裙女孩在雪地里奔跑”,结果生成了“一位蓝色外套的男孩在草地上行走”。
1.3.2 
技术盲区:传统加权打分机制下,优异的“画质得分”(清晰度、色彩、流畅度)容易掩盖致命的“语义错误”(主体全错),导致系统被“补偿”判定为 Pass。
2. 破局思路:抛弃“纯端到端”执念,回归工程化本质
2.1 “纯端到端大模型”落地实践分析
2.1.1 算力成本极高:所有视频全量调用大模型 API,成本难以支撑工业级海量并发。
2.1.2 处理时延高:数秒甚至数十秒的推理时延,无法做到实时反馈。
2.1.3 容易产生幻觉与黑盒化:大模型自身容易产生视觉幻觉,且评估标准呈黑盒化,难以通过硬规则拦截明确的业务底线问题。
2.2 我们的工业级解法:漏斗式分层混合架构
2.2.1 计原理:大模型作为最后的仲裁兜底,而非前置的全能裁判。前置低算力的 L1/L2 层进行“快速剪枝”。
2.2.2 优势对比:极低的检测成本与阶梯式处理时延,同时通过硬门槛具备极强的可解释性与控制力,规则变更易于迭代维护。
3. 核心架构深度解析:如何用“漏斗”与“路由”打造精准防线
3.1 核心架构全景:分层混合与并行分发
3.1.1 设计理念:平衡检测精度、算力成本与系统延迟,构建“漏斗式分层混合架构”。
3.1.2 架构说明:前端引入意图复杂度路由,将标准场景流转入三层漏斗,复杂叙事/特定约束场景分发至专用检测链路,两者并行独立流转,最终通过大模型深度仲裁,实现精准拦截。
3.2 意图复杂度路由(Complexity Router)实现机制
3.2.1 核心职责:判断 Prompt 意图复杂度,决定分发链路。
3.2.2 三级优先级判断逻辑:
- 优先级 1(强触发 → 特殊场景流):包含时间序列词、参考图输入、引号文本、口型/舞蹈/音乐相关词。
- 优先级 2(可叠加):多条件命中时并行触发多个特殊插件。
- 优先级 3(默认 → 标准漏斗流):未命中条件进入标准三层漏斗。
3.2.3 技术落地路径:正则/关键词规则匹配 -> 轻量意图分类模型 -> Scene Profile 静态配置。
3.3 Layer 1 (L1):基础合规与画质的前置拦截 (Fail Fast)
3.3.1 基础规范与参数合规检测:校验基础容器、视频流、音频流等是否符合通用标准与产品规范。
3.3.2 严重画面瑕疵检测:前置拦截黑白屏/纯色、静帧/卡顿、花屏/撕裂、模糊失焦、频闪、严重偏色与曝光异常等基础缺陷废片。
3.3.3 视频风格初筛与分类:利用轻量级模型对视频的整体美术风格(如二次元、超写实、3D动画、赛博朋克等)进行快速分类打标。此分类结果作为元数据透传至精筛层(L2),为不同风格视频动态调整评分及格线与权重提供前置基础,避免“一把尺子量天下”导致的误杀与漏放。
3.4 Layer 2 (L2):多维一致性判决与槽位门控(核心业务逻辑层)
3.4.1 基础多维特征打分逻辑(先不加权):并行计算语义(0.30)、实体(0.25)、空间(0.15)、时间(0.15)、风格(0.10)、逻辑(0.05)。
3.4.2 语义槽位与时序意图解析: 提取 who/where/what/count 槽位,针对多镜头拆解复杂时序子意图。 多镜头时序意图解析:将多镜头视频中的意图拆解为多个子意图,并在每个子意图中分别提取对应的一组核心槽位。例如:
3.4.3 原意图:一位红色连衣裙女孩在雪地里奔跑,两个蓝色外套的男孩在草地上行走。
3.4.4 槽位维度:who/where/what/count(可定义)
3.4.5 子意图拆解:
-  子意图1(女孩视角):['女孩'(who),'雪地'(where),'奔跑'(what),'1人'(count)]
-  子意图2(男孩视角):['男孩'(who),'草地上'(where),'行走'(what),'2人'(count)]
3.4.6  槽位覆盖率:原意图中的主体、场景、动作等关键元素(who/where/what/count)均被 100% 完整解析并分配至对应子意图中,无槽位遗漏。
3.4.7 亮点技术:硬门槛(Hard Gate)机制彻底解决高分陷阱:强制核心维度及格线(semantic >= 0.72)与关键槽位覆盖率。任一未达标直接触发 Fail,不进入加权计算。
3.4.8 加权总分计算与软惩罚:通过门控后计算加权分,对次要槽位未对齐实施降分惩罚。
3.5 Layer 3 (L3):多模态大模型的深度仲裁 (端到端方案)
3.5.1 触发条件:精细化控制,仅针对 L2 打分在 [0.65, 0.82] 区间(可自定义)的“边界样本”触发。
3.5.2 深度审计:从五个原子级维度进行推理,输出最终判定建议及结构化的“语义盲点与幻觉清单”。
4. 工程化治理:让检测体系适应业务的快速发展
4.1 特殊场景的定制化方案:专用检测插件
4.1.1 多镜头强叙事检测:检验跨镜头角色身份的连续性与宏观逻辑。
4.1.2 ID 强保真检测:电商/数字人引入 Re-ID 进行像素级比对,严防品牌 Logo 或人脸变形。
4.1.3 时序 OCR 检测:检验连续帧拼写一致性,拦截文字闪烁与乱码。
4.1.4 音视频对齐与物理约束检测:针对口型/舞蹈场景计算跨模态特征相关性并拦截严重物理穿模。
4.2 研发与业务解耦:规则外置与动态配置引擎(Rule DSL)
4.2.1 业务痛点:每次调整拦截标准都需要修改代码发版,效率偏低,容易引发规则爆炸。
4.2.2 解决方案:所有的硬门槛、软惩罚权重、场景阈值全部通过 YAML 动态配置进行外置。
4.2.3 业务赋能:产品和运营可自助调整不同场景的准入规则和阈值,无需发版实时生效,极大降低维护成本。
5. 落地复盘:数据收益与工程化实践经验
5.1 核心收益盘点
5.1.1 成本显著下降(大模型调用预估下降 70%+)、响应速度跃升(P90 < 3s)、核心语义漏检率大幅降低(60%+)。
5.2 工程化落地遇到的问题和解决方案
5.2.1 多模态特征计算异构风格下的阈值漂移:固定绝对阈值在多风格混编中易误杀。
缓解措施:
在 L1 增加轻量级风格分类器及下发风格对应的:百分位阈值和权重分,L2 的多维度打分和 Hard Gate 阈值根据风格动态加载。
5.2.2 L3 大模型并发限流与成本黑洞:边界样本涌入直接打爆外部多模态大模型 API 的 TPM/RPM 限制。
缓解措施:
① 实施动态降级熔断退回 L2 层硬判;
② 构建内部数据飞轮,用 L3 层高质量判定结果微调本地开源多模态小模型以逐步替代昂贵的闭源大模型。
6. 挑战与未来展望
6.1 当前面临的技术难点
6.1.1 长视频的挑战:分钟级视频(微短剧)的长程身份一致性与宏观剧情因果推理。
6.1.2 大模型时延瓶颈:高并发下 L3 深度仲裁的时延与成本依然是关键限制。
6.1.3 主观美学与情感评价的量化鸿沟:如何让机器像导演一样评估“运镜美感”和“情感张力”。
6.2 下一步的演进方向
6.2.1 边生成边检测:在视频模型刚开始“打草稿”的早期阶段,系统就会介入分析初步特征。一旦发现内容严重偏题或画质崩塌,便会立即叫停生成任务,从而为业务节省大量的算力成本。
6.2.2 用“专精小模型”替代昂贵的通用大模型:长期依赖通用大模型,不仅成本高昂且存在数据隐私风险。未来,我们将利用前期积累的真实判定数据,训练出专门用于“找缺陷”的本地化小模型。这些小模型在视频质检这一专门领域的表现,甚至能媲美通用大模型,彻底解决高并发下的性能和成本瓶颈。
6.2.3 规则配置“大白话”与免代码迭代:只需用自然语言写下要求,系统就能自动理解并执行对应的检测流程。全程无需开发人员改代码,实现检测规则的极速更新。
6.2.4 检测反哺生成:检测高质量视频,将“优秀范例”作为“奖励”,将“反面教材”作为“惩罚”,持续不断地反馈给上游的视频生成模型。通过这种持续不断的“错题本”机制,推动 AI 视频生成质量越好。

听众收益:
1. 方案升级:破解 AI 视频评测的“不可能三角” 深入剖析传统加权打分机制在 AI 视频场景下的失效原因(揭秘“高分补偿陷阱”),理解纯端到端多模态大模型在成本、时延与幻觉上的工业化局限,掌握 AI 原生视频内容质量保障的全新破局思路。
2. 架构解析:掌握“漏斗式分层混合架构”的设计精髓 学习如何设计一套兼顾低成本与高并发的混合检测架构。掌握意图复杂度路由(Complexity Router)的分发逻辑,以及 L1(基础画质)、L2(多维特征与槽位门控)、L3(大模型深度仲裁)三层漏斗的递进式拦截策略。
3. 技术实战:核心痛点攻坚与特殊场景应对策略 了解如何利用 NLP 语义槽位拆解与 Hard Gate(一票否决)机制实现 100% 确定性的致命缺陷拦截;学习针对多镜头强叙事、电商 ID 强保真、带字视频 OCR 等高难边界场景的专用插件化检测方案。
4. 工程落地:构建高敏捷、低成本的动态治理体系 获取将算法策略转化为工程化交付的实战经验,学习如何通过 Rule DSL(YAML 动态配置)将检测标准外置,实现无需研发发版即可实时生效的业务自助化迭代,大幅降低系统的长期维护成本。
时零
bilibili 高级测试开发工程师
哔哩哔哩 高级测试开发工程师。主要负责营收业务的质量保障与提效
工具开发,方向覆盖 Web 性能、Web AI 自动化测试、测试数据构造(造数)等。
擅长领域:AI Agent 在测试场景的工程化落地、复杂前端(弹窗/面板/跨域 iframe/H5)
UI 自动化、断言可靠性设计、测试数据构造与测试效能建设。

【任职经历】
毕业后曾就职于美团,负责首页业务的质量保障工作,积累了大流量核心页面的质量
保障与测试体系经验;现于哔哩哔哩负责直播营收业务的质量保障与提效工具建设。

【团队背景】
所在团队负责 B 站直播营收业务(礼物、弹幕、天选、大航海、榜单、PK 等)的质量
保障与测试效能建设。直播营收链路具有"UI 交互复杂、页面状态强依赖前置数据、
断言难以标准化"三大特征,传统自动化测试维护成本高、覆盖率难以提升。团队围绕
这些痛点,将 AI Agent 引入 UI 自动化测试与测试数据构造,持续探索"从辅助到自治"
的测试提效路径。

【项目经验】
主导/深度参与两套面向内部的 AI 测试基础设施建设:
· AI 浏览器自动化测试平台(PortKey / 门钥匙)——基于 browser-use + CDP,用
  自然语言描述用例即可驱动浏览器完成直播间 UI 测试,支持 Agent 逐步决策与
  代码生成双模式,具备步骤级/任务级评估、DOM+视觉组合断言、跨域 iframe/H5
  取证、多模型 Provider 与并发调度等能力;
· 测试数据构造 Agent(AgentQ,上游供给)——自然语言编排接口调用链,在 UAT
  环境构造测试数据,通过 MCP 协议与执行平台解耦协作,形成"造数据→跑 UI→
  自动判定"闭环。

上述能力已实际落地到直播营收多轮回归与大型专项(巅峰之夜、PK、天选等)的
日常测试中。
待定
待定
AI UI 自动化测试中的"判定可信度"工程
——直播营收业务里驯服 Test Oracle 的实战
议题背景:
用 AI Agent 驱动浏览器做 UI 测试,"把流程跑通"已不难,真正的拦路虎是测试最古老的难题——测试预言(Test Oracle):当判定对错的"判官"从人换成概率模型,它说的"通过"到底可不可信?直播营收业务尤其棘手:UI 交互复杂、控件深藏跨域iframe/H5、页面状态强依赖前置数据、断言难以标准化。我们基于 browser-use + CDP搭建 AI 自动化测试平台,用"Agent 决策 + 代码生成"双模式平衡灵活性与可复现性,以"步骤级评估 + 任务级评审 + DOM/视觉组合取证"压制假阳性判定,配合错误熔断与自愈控制成本,并用造数 Agent 作为上游供给打通"造数据→跑 UI→自动判定"闭环。平台已累计执行超千次真实任务,稳定回归用例集判定准确率达 100%(零误判);通过分层重试把断言空响应存活率从 19% 提升到 96%,每步执行耗时下降 33%,并让失败原因100% 可归因。本议题分享这套体系的关键实现、踩坑经验与在多轮回归、大型专项中的落地效果。

内容大纲:
括号内为可量化支撑,均取自项目内真实报告;标 [团队确认] 的一处用真实回归工时补齐。
1. 问题:AI 测试的"判定可信度"危机
1.1 测试预言(Test Oracle)问题——判官换成模型后,"通过"为何不可信
1.2 直播营收的三重放大器:高交互 / 强状态依赖 / 弱可断言
1.3 业界 Demo 的止步之处:跑通 ≠ 可回归(先立靶子)
2. 执行层:自主性与可复现性的取舍
2.1 双模式设计——Agent 逐步决策(探索)vs 代码生成(回归固化)
2.2 为什么回归场景必须"固化":同一用例两次跑出两条路径的翻车实录
2.3 选型边界:什么场景用哪种模式(附决策表)
3. 判定层:把假阳性摁下去(全场核心)
3.1 假阳性 > 假阴性——"看起来绿了"的静默漏网为何更致命
3.2 三级判定:step 级评估 → Judge 模型任务级评审 → DOM/视觉组合取证
3.3 什么时候信 DOM、什么时候必须上视觉:一组误判 case 拆解
3.4 踩坑实录:一次上游空响应如何被"错误计数耦合"放大成整个任务失败(上游故障率从 18% 劣化到 81% 期间的真实事故复盘)
3.5 收益:断言空响应存活率从 19% 提升到 96%(Layer A+B 分层重试);25 条批量重跑抽样复核,成功/失败/unknown 三类标签判定准确率 100%(零误判)
4. 取证层:拿不到证据的地方怎么取证
4.1 跨域 iframe / H5 的同源策略死角
4.2 DOM → CSS+文本 → 视觉 三级 fallback 定位
4.3 踩坑:iframe 断言失效、H5 滚动穿透的定位与修复
5. 成本与稳定:给 Agent 装刹车   
5.1 错误归类:LLM 服务故障 vs 断言失败 vs 决策失败,不能共用一个重试预算
5.2 熔断与快速失败——阻断"换参数碰运气"式空转
5.3 收益(基于 1171 条真实任务前后对比):
5.3.1 平均每步耗时 -33%(21.6s → 14.4s),核心工作区 -38%(18.0s → 11.1s)
5.3.2 单任务平均 token -9.2%;极端失控任务从 3468s 压到 551s
5.3.3 失败模式从"慢速反复重试"转为"早期快速失败"(失败任务每步耗时反低于成功任务)
6. 上游供给:造数如何喂饱执行(辅助线)
6.1 用例跑不起来的真因:PK 没开、天选没发
6.2 造数 Agent(1100+ 原子操作、80+ 场景编排)经 MCP + <<..>> 造数块解耦接入
6.3 "取资产与做操作永远分两步"的编排纪律
7. 落地效果与结论
7.1 覆盖专项:巅峰之夜 / PK / 天选等大型活动回归,累计执行超千次真实任务、覆盖 7+ 业务工作区
7.2 判定质量:稳定回归用例集单批通过率 68%,其中成功/失败/unknown 三类标签判定准确率 100%(零误判)——AI 给出的"通过/失败"结论与人工复核完全一致
7.3 失败 100% 可归因:业务断言不通过 / 环境错误 / LLM 服务故障分类清晰,让"AI 测挂了"从黑盒变成可分类、可治理的工程问题
7.4 回归提效:一轮直播营收回归用例的人工执行成本由 [团队确认] 压缩至 [团队确认]
7.5 结论:AI 测试走向"自治",胜负手是判得准、停得住、跑得稳
7.5.1 数据来源:任务执行指标报告(超千条真实任务)、视觉断言稳定性迭代分析、批量重跑
7.5.2 复核报告,均为项目内已发生的真实数据。标注 [团队确认] 的回归提效数据请用真实
7.5.3 回归工时填写(建议口径:一轮回归从 X 人天缩短至 Y 小时),这是评审最买账的收益指标。

听众收益:
1. 一套可复用的"AI 判定可信度"工程范式:如何用步骤级+任务级+DOM/视觉组合取证,系统性压制 AI 测试的假阳性,而不是靠调 prompt 碰运气——这套方法论可直接迁移到任何 AI 驱动的 UI/接口自动化场景。
2. 复杂前端的实战解法:跨域 iframe / H5 取证、Agent 决策与代码生成的选型边界、错误熔断与成本控制等一线踩坑经验,帮听众避开把 AI 测试推向生产时的典型深坑。
3. 从"能跑 Demo"到"进回归流水线"的完整判断标准:什么样的 AI 测试能力才算真正可上生产,以及造数—执行—判定闭环如何协作落地,给正在评估或建设同类平台的团队一份可对照的决策参考。
陈营
58同城 高级研发工程师
58同城本地服务技术部高级研发工程师。目前主要负责本地服务质量保障团队测试工具研发工作,参与智能测试平台与 Agent 应用配套的全流程质量保障体系建设,实现 Agent 驱动自动化测试技术在工程体系内的规模化落地,聚焦自动回归测试、智能用例生成等关键场景持续迭代优化,推动团队测试能力智能化、自动化升级。不断完善测试流程,拉高自动化执行效率,为业务高速迭代夯实工程效能底座。在实践过程中曾发表过多项发明专利。
待定
待定
让 Agent 学会接管自己:测试 Agent 自主闭环执行范式探索
议题背景:
现有测试 Agent 仅能单次执行,故障中断后需人工介入,存在上下文丢失、重复试跑损耗大等问题。本次方案搭建六段式联动架构,以闭环引擎为调度核心,搭配知识层动态供给业务信息,分层设计故障解析、策略生成、动态重规划三类智能体。核心采用渐进式按需知识加载、多维度故障分级差异化接管、链路重构与经验自进化技术,规避全量加载上下文溢出、无差别暴力重试、流程固化等工程难题。落地后故障自主修复率显著提升,大幅降低人工介入频次,证实该分层 Agent 闭环范式可实现测试任务自主接管,完成从执行工具到自治任务载体的升级。

内容大纲:
1. 为什么需要自动接管Agent
1.1 从人工驱动到 Agent 驱动:测试执行模式正在变化
1.2 测试 Agent 面临的新挑战
1.2.1 能执行 ≠ 能完成:任务完成能力缺失
1.2.2 任务状态持续理解能力不足
1.2.3 异常情况下自主恢复能力有限
2. 构建自主接管Agent
2.1 面向任务完成的自主闭环架构
2.1.1 构建自主闭环运行体系
2.1.2 自动接管控制中枢设计
2.2 多Agent协同机制
2.2.1 能力模块职责划分
2.2.2 多Agent协同执行流程
2.3 自动接管Agent核心能力升级
2.3.1 从被动执行到主动恢复
2.3.2 从流程完成到任务完成
3. 如何实现自动接管能力
3.1 多维故障理解
3.1.1 为什么需要故障理解
3.1.2 多维故障理解整体流程
3.2 渐进式知识加载
3.2.1 传统知识加载存在的问题
3.2.2 基于任务状态驱动的知识补充机制
3.3 差异化策略生成
3.3.1 多维故障分类体系
3.3.2 差异化恢复策略生成
3.4 动态任务重规划
3.4.1 动态任务链路调整机制
3.4.2 重规划执行流程
3.5 经验沉淀与持续进化
3.5.1 为什么需要经验沉淀
3.5.2 经验生成与持续优化
4. 工程落地实践
4.1 项目整体落地实践
4.2 自动接管运行流程展示
4.3 当前能力边界与后续优化方向
5. 未来规划
5.1 内容总结与回顾
5.2 从自动接管走向测试工程自治


听众收益:
1. 掌握测试 Agent 从 “只会执行” 到 “自主闭环接管” 的工程落地方法论,解决现有自动化体系中自动执行失败即中断的行业长期痛点
2. 获取大模型 Agent 上下文过载、业务知识难以联动执行层等问题的经过线上验证的成熟工程解法,规避自研智能测试Agent常见技术坑
关注QECon公众号
议题投稿
speaker@qecon.com.cn
商务合作
151-2264-3988  木子
票务联系
135-2067-8913  媛媛
媒体合作
135-1619-6409  皮皮
添加QECon小助手,获取
会议最新资讯
购票咨询
13520678913  媛媛
服务总线
400-183-9980  
电话咨询
联系电话:
13520678913 媛媛