第 14 章:学习与训练:治理下的自适应
14.1 工程问题的本质:学习与安全如何共存
智能体系统必须从反馈中改进——用户纠正"这句话识别错了"、训练产出"这个新词属于这个意图"、审批决定"这条规则允许"。但学习本身就是风险:一个能被任意修改的规则系统,其规则不再可信。
设计原理: 学习的工程核心不是"能不能学",而是学习与治理的边界。框架的统一答案:写库(学习必须发生)→ 审批(生效必须受控)→ 热更新(无需重启)。学习永远被记录,生效永远被治理,落地永远不需要重启——三者缺一,学习就会滑向"学不了"或"失控"两个极端。
14.2 反馈回路:从纠正到生效的闭环
L1(用户显式纠正)的闭环:纠正写入三通道(审批记录 + 规则表待审批行 + 训练样本)→ 审批链推进 → 通过后启用 + 热更新 → 识别链路第一步即时命中。
原理: 历史上 L1 反馈曾直接生效,存在绕过审批的风险——学习成果直接改变行为,等于用户可以无治理地改变系统规则。改为审批制后,学习的记录与生效被分离:纠正永远被记录(三通道写入),但生效必须经审批。这一设计承认学习的价值(记录不设门槛),同时拒绝学习失控(生效必经治理)。
14.3 可训练对象的边界:一切皆可训练,硬规则除外
可训练对象覆盖意图规则、槽位、子意图关键词、消歧配置、规则逻辑、审批链、流程定义、模块开关、权限矩阵——但硬规则(bypass=false)与 SOD 不可训练。
原理: "一切皆可训练"服务于业务自适应的广度;"硬规则除外"守护治理的根基。若连"成本线""SOD"都可训练,治理就失去了参照系——训练自己给自己开绿灯成为可能。可训练性是一把以硬规则为轴心的伞:伞面越宽(可训练对象越多),轴心越必须坚固(硬规则越不可动)。
14.4 热更新:把"发版"变成"改数据"
训练生效的核心是进程级缓存失效:规则重载(reload_rules / 周期轮询)、槽位与子意图缓存失效(invalidate_cache)、规则参数缓存清除。
原理: 热更新的工程意义是把"上线"从部署动作变为数据动作。发版需要发布窗口、回滚计划、环境检查;改数据只需要审批通过 + 缓存失效。配置治理的价值正是使高频的、业务侧的调整不必经过低频的、工程侧的发布流程——变更的节奏匹配业务,而非匹配工程。热更新的前提是配置有版本与审批记录,可追溯、可回滚。
14.5 训练数据驱动的识别增强
训练样本反向增强识别:查询意图白名单由已审批样本动态加入(仅收录查询意图,执行意图不收录避免打断多轮延续);few-shot 样本按相似度动态选样(每意图限流 + 基线保底)。
原理: 这两个决策体现"训练影响识别"时的两个约束。白名单只收查询意图:执行意图的样本("我要入库"→stock_in)若进入白名单,会在多轮收集中打断 pending 延续——学习的成果不能以破坏对话状态为代价。few-shot 动态选样:全量注入成本高且新意图会挤出核心正例,相似度选样让"最相关的样本"进入上下文,兼顾质量与成本。
14.6 学习效果的评估与样本质量
14.6.1 评估体系:学习要证明有效
训练是否改善了系统,必须可度量。评估体系围绕"行为是否变好"设计:
| 指标 | 定义 | 观察对象 |
|---|---|---|
| 意图识别准确率变化 | 训练前后准确率差 | 识别器(回归测试集) |
| 误路由率 | 错误路由 / 总输入 | 路由层(线上采样) |
| 规则命中率变化 | 训练后高频句式命中 | 规则层 |
| 审批通过后的生效率 | 生效规则 / 审批通过规则 | 训练链路(治理健康度) |
| 误报修正率 | 用户纠正后同输入不再错 | L1 反馈闭环 |
原理: 评估的工程要点是回归基线——每次训练变更应跑同一组测试样本,观察准确率是否回退。没有回归基线,"训练"就变成不可验证的行为改变:改了、上线、不知道好坏。学习与评估是一体两面:不评估的学习不可信,不学习的评估无意义。
14.6.2 样本质量:标签噪声与数据泄漏
训练样本的两个经典质量问题,在"人机协同训练"场景下同样存在:
| 问题 | 场景 | 应对 |
|---|---|---|
| 标签噪声 | 用户纠正本身就是错的(纠正到错误意图) | 审批制(人工确认纠正),不直接生效 |
| 数据泄漏 | 测试样本进入训练集,评估虚高 | 训练/评估样本分离,版本化样本集 |
原理: 人机协同训练的样本源是"用户纠正"与"训练产出"——两者都可能错。审批制正是对标签噪声的结构性过滤:只有经过审批的纠正才影响行为。数据泄漏的应对是样本的版本化与集分离——训练集与评估集不重叠,评估结果才可信。这两个问题的共同本质是:训练数据与验证数据的可信度必须分开治理。
14.7 失败模式与权衡
| 失败形态 | 根因 | 设计应对 |
|---|---|---|
| 学习成果绕过治理 | L1 直接生效 | 三通道写入 + 审批制 |
| 训练给自己开绿灯 | 硬规则可训练 | 硬规则/SOD 不可训练 |
| 训练成果不生效 | 缓存未失效 | 热更新 + 周期轮询 |
| 白名单打断多轮 | 执行意图进白名单 | 仅收查询意图 |
权衡: 审批制延迟了学习生效(纠正后需审批才能改变行为),换取治理安全。这是"改进速度"与"治理安全"的平衡点,且该平衡点可由业务侧调节——审批链的步数与角色本身可训练(治理之治理)。
14.8 本章小结
- 学习的核心是学习与治理的边界,而非学习能力本身;
- 写库-审批-热更新三者缺一,学习滑向"学不了"或"失控";
- 学习记录与生效分离:记录无门槛、生效必经治理;
- 可训练性是以硬规则为轴心的伞,轴心不可动;
- 热更新使变更节奏匹配业务而非工程。