意图驱动测试:我们在 AI 记忆产品里怎么测,踩过什么坑
议题背景:
我们做 AI 记忆,链路很长:话怎么说进去、怎么存、怎么搜出来、最后怎么回到用户身上。AI 记忆类产品难测,难在整条链路是意图理解→写入→检索→个性化响应,传统自动化容易退化成堆 URL 和参数,和用户到底想达成什么脱节;接口调整后,用例报错,分不清是契约变了还是业务错了。我们的做法是意图驱动:用例先写清业务意图想验证什么,再把能复用的动作沉淀成步骤库,数据放进独立语料,代码只负责串起来和断言;同时把接口文档当作契约,在成功响应后自动做结构级对比,让契约漂移在集成阶段就暴露,而不是靠人肉对文档。工程上坚持上下文进前置、业务动作全显式,避免把创建/搜索藏进前置里,排障时无从追溯。覆盖上用特性矩阵 + 改进计划把缺口写成可跟进的项(例如搜索隔离、负向路径)。落地后自动化规模可观,手工留一条端到端链,补自动化够不着的场景。文档和经验以前跟着人和会话走,现在用记忆系统把「怎么测、出过什么坑、业务数据」都留下来,后面的人不用从头问。并用量化的效率与一致性指标(如对话轮数、AI检测)看飞轮是否在转。
内容大纲:
1. 接口脚本为什么不够用
1.1 记忆产品特殊在哪:意图和状态缠在一起,异步、多租户一来就乱
1.2 我们踩过的坑:契约悄悄变、数据写进代码、前置里藏业务动作
2. 意图驱动到底驱动什么
2.1 意图—契约—步骤—数据,各管一摊
2.2 从「想测什么」到可跑用例,最短路径怎么走
2.3 一条原则:上下文可以隐掉,动作必须能看见
3. 契约怎么左移
3.1 文档写清成功长什么样
3.2 没契约别合并——不然漂移永远后知后觉
3.3 单契约形态和整条用户旅程,两层场景怎么分
4. 数据拆开、执行切片
4.1 语料按场景堆,不按接口列表堆
4.2 多环境数据怎么回退、怎么不互相污染
4.3 冒烟、回归、负向、一致性——用标记区分
5. 覆盖不靠感觉
5.1 特性矩阵:一眼看出哪里没盖住
5.2 改进计划:P0/P1 写清楚,能验收
5.3 手工验收和自动化,各管哪一段
6. 经验别只活在聊天窗口里
6.1 静态文档的短板:每次重来
6.2 规划、写用例、执行、复盘——记忆在哪一步介入
6.3 飞轮怎么量:轮数、符合率、重复踩坑次数
7. 收尾
7.1 几个Concrete 坑:前置滥用、语料里写调用、契约没进流水线
7.2 和现有 CI、文档怎么共存,开源怎么推
听众收益:
1. 回去能改自己业务的自动化场景:意图—契约—步骤—数据怎么切、前置里该不该塞业务,能对照自查,不用先直接上框架。
2. 契约左移可操作:文档定义 + 结构对比 + 合并门禁
3. 覆盖和知识能写成清单:矩阵和改进计划替代补用例,记忆知识替代问老员工