从人盯流程到流程找人:推荐系统长程发布的 Harness 工程实践
议题背景:
AI Coding 已将代码产出提速,但从代码完成到全量上线,交付效率没有同步提升。构建、测试、发布、检测等平台各自自动化,环节之间却仍靠工程师读取结果、确认条件、手动启动下一步。一条推荐核心服务的发布横跨十几个部署组,平均持续十多个小时,还需要等待次日效果观察窗口;平台能执行动作,却无法替人持续记住目标、衔接等待、处理例外。
我们曾将发布知识沉淀为近 20 万字的 Skill 操作手册,希望模型按说明调用工具。结果只是把“盯平台”换成了“盯模型”:提示词可以描述禁令,却无法替代发布范围、步骤顺序、通过条件这些必须在运行时成立的硬约束;一次参数漏传,就可能使灰度发布越过边界。
问题的本质不是 Agent 会不会调工具,而是一条 Long-Running + Long-Horizon 的流程,谁来承担跨会话的记忆、基于真实现场的推进、不可逆动作前的确认,以及每一步效果的验证。
小红书推荐发布 Agent 因此不把 Agent 当作流程执行者,而是构建了一套 Harness:任务实体保存唯一权威状态,流程模板定义可执行边界,引擎以 Reconciliation Loop 持续推进,外部动作以 Outbox 与效果查证保证可恢复;Agent 只负责理解异常、整理证据、生成处置提案,人只在目标、风险与授权边界上做决策。系统已贯穿代码评审、质量验证与全量上线;当前生产观察中,单次发布平均仍需约 2 次人工介入,而每一次介入都会进入治理闭环,成为扩展自主范围的候选。
内容大纲:
1. 交付的新瓶颈:工程师的注意力
1.1 平台动作早已自动化,真正断在平台之间:读取结果、确认条件、启动下一步仍由人接力。
1.2 推荐发布为何天然是 Long-Running + Long-Horizon:跨昼夜等待、步骤强依赖、环境变化、反馈稀疏且错误不可逆。
1.3 从“给模型更多工具和提示词”转向“谁持续承担流程责任”:流程延续归系统、理解研判归 Agent、取舍授权归人。
2. 反思:Skill 承载知识,却承载不了运行时约束
2.1 从脚本串联到近 20 万字操作手册:知识补得越多,为什么工程师仍必须值守。
2.2 提示词中的禁令无法替代系统中的硬约束:参数默认值、平台隐含顺序、真实状态并不天然在模型上下文中。
2.3 发布范围、步骤顺序、通过条件必须脱离模型推理路径,成为可验证的运行时机制。
3. Harness:可靠推进长程发布
3.1 四个实体:流程模板、任务、引擎、提案——将执行结构、权威状态、持续推进与人工介入分离。
3.2 任务是会话之外的现场:模板版本与参数在发起时固化为基线;进度、平台结果、待办和人工决定持续保存,多实例通过乐观锁协作。
3.3 引擎以 Reconciliation Loop 推进:每次从当前任务状态重新推导可执行步骤,恢复依赖重算,不依赖回放历史。
3.4 外部动作可靠性:Transactional Outbox、稳定动作标识、幂等键与平台效果查证;不承诺 exactly-once,而是 at-least-once + 效果查证。
3.5 人工介入统一走提案:自然语言先生成计划与影响说明,经确认后写入任务;状态变化则重新预演,避免旧计划污染新现场。
4. 自主边界:系统何时推进,何时找人
4.1 用四条 admission criteria 划定可自主范围:可观测、可停止/回退、影响范围可控、判断可靠。
4.2 可验证的异常由框架消化:例如调用超时后查证平台事实、有限重试、超限即停。
4.3 涉及业务取舍和线上风险的异常交还给人:系统挂起任务、整理证据与选项,而不是替人决定风险接受度。
4.4 Agent 的角色不是直接执行自然语言,而是从分散事实和业务意图中推导可审阅、可确认的处置方案。
5. 双闭环:从人工介入中扩大自主范围
5.1 执行闭环保证单次发布持续完成:观察、推进、验证、暂停与恢复。
5.2 治理闭环把每次人工介入的原因、依据、决定与结果沉淀为流程改进输入。
5.3 自主能力不是设计出来的:模板补充、离线评测、影子运行、线上结果验证和明确授权,逐步将可验证场景迁入系统。
5.4 从 Human on the Loop 到 Human design the Loop:人从处理每次例外,转向定义目标、风险边界与授权规则。
听众收益:
1. 一套长程 Agent 的 Harness 划分原则:将状态、流程推进、外部动作、异常研判和人工授权放回各自能稳定承担责任的位置,而非用提示词兜底。
2. 一组可落地的可靠性设计:权威任务状态、Reconciliation Loop、config-as-of、Transactional Outbox、at-least-once + 效果查证,以及 plan & apply 的人工介入机制。
3. 一套渐进式自主方法:用可观测、可回退、范围可控、判断可靠四个条件划定自主边界;把人工介入转化为可评测、可灰度、可迁入的治理资产。