第 14 章:学习与训练:治理下的自适应

14.1 工程问题的本质:学习与安全如何共存

智能体系统必须从反馈中改进——用户纠正"这句话识别错了"、训练产出"这个新词属于这个意图"、审批决定"这条规则允许"。但学习本身就是风险:一个能被任意修改的规则系统,其规则不再可信。

设计原理: 学习的工程核心不是"能不能学",而是学习与治理的边界。框架的统一答案:写库(学习必须发生)→ 审批(生效必须受控)→ 热更新(无需重启)。学习永远被记录,生效永远被治理,落地永远不需要重启——三者缺一,学习就会滑向"学不了"或"失控"两个极端。

14.2 反馈回路:从纠正到生效的闭环

L1(用户显式纠正)的闭环:纠正写入三通道(审批记录 + 规则表待审批行 + 训练样本)→ 审批链推进 → 通过后启用 + 热更新 → 识别链路第一步即时命中。

原理: 历史上 L1 反馈曾直接生效,存在绕过审批的风险——学习成果直接改变行为,等于用户可以无治理地改变系统规则。改为审批制后,学习的记录与生效被分离:纠正永远被记录(三通道写入),但生效必须经审批。这一设计承认学习的价值(记录不设门槛),同时拒绝学习失控(生效必经治理)。

14.3 可训练对象的边界:一切皆可训练,硬规则除外

可训练对象覆盖意图规则、槽位、子意图关键词、消歧配置、规则逻辑、审批链、流程定义、模块开关、权限矩阵——但硬规则(bypass=false)与 SOD 不可训练。

原理: "一切皆可训练"服务于业务自适应的广度;"硬规则除外"守护治理的根基。若连"成本线""SOD"都可训练,治理就失去了参照系——训练自己给自己开绿灯成为可能。可训练性是一把以硬规则为轴心的伞:伞面越宽(可训练对象越多),轴心越必须坚固(硬规则越不可动)。

14.4 热更新:把"发版"变成"改数据"

训练生效的核心是进程级缓存失效:规则重载(reload_rules / 周期轮询)、槽位与子意图缓存失效(invalidate_cache)、规则参数缓存清除。

原理: 热更新的工程意义是把"上线"从部署动作变为数据动作。发版需要发布窗口、回滚计划、环境检查;改数据只需要审批通过 + 缓存失效。配置治理的价值正是使高频的、业务侧的调整不必经过低频的、工程侧的发布流程——变更的节奏匹配业务,而非匹配工程。热更新的前提是配置有版本与审批记录,可追溯、可回滚。

14.5 训练数据驱动的识别增强

训练样本反向增强识别:查询意图白名单由已审批样本动态加入(仅收录查询意图,执行意图不收录避免打断多轮延续);few-shot 样本按相似度动态选样(每意图限流 + 基线保底)。

原理: 这两个决策体现"训练影响识别"时的两个约束。白名单只收查询意图:执行意图的样本("我要入库"→stock_in)若进入白名单,会在多轮收集中打断 pending 延续——学习的成果不能以破坏对话状态为代价。few-shot 动态选样:全量注入成本高且新意图会挤出核心正例,相似度选样让"最相关的样本"进入上下文,兼顾质量与成本。

14.6 学习效果的评估与样本质量

14.6.1 评估体系:学习要证明有效

训练是否改善了系统,必须可度量。评估体系围绕"行为是否变好"设计:

指标定义观察对象
意图识别准确率变化训练前后准确率差识别器(回归测试集)
误路由率错误路由 / 总输入路由层(线上采样)
规则命中率变化训练后高频句式命中规则层
审批通过后的生效率生效规则 / 审批通过规则训练链路(治理健康度)
误报修正率用户纠正后同输入不再错L1 反馈闭环

原理: 评估的工程要点是回归基线——每次训练变更应跑同一组测试样本,观察准确率是否回退。没有回归基线,"训练"就变成不可验证的行为改变:改了、上线、不知道好坏。学习与评估是一体两面:不评估的学习不可信,不学习的评估无意义

14.6.2 样本质量:标签噪声与数据泄漏

训练样本的两个经典质量问题,在"人机协同训练"场景下同样存在:

问题场景应对
标签噪声用户纠正本身就是错的(纠正到错误意图)审批制(人工确认纠正),不直接生效
数据泄漏测试样本进入训练集,评估虚高训练/评估样本分离,版本化样本集

原理: 人机协同训练的样本源是"用户纠正"与"训练产出"——两者都可能错。审批制正是对标签噪声的结构性过滤:只有经过审批的纠正才影响行为。数据泄漏的应对是样本的版本化与集分离——训练集与评估集不重叠,评估结果才可信。这两个问题的共同本质是:训练数据与验证数据的可信度必须分开治理

14.7 失败模式与权衡

失败形态根因设计应对
学习成果绕过治理L1 直接生效三通道写入 + 审批制
训练给自己开绿灯硬规则可训练硬规则/SOD 不可训练
训练成果不生效缓存未失效热更新 + 周期轮询
白名单打断多轮执行意图进白名单仅收查询意图

权衡: 审批制延迟了学习生效(纠正后需审批才能改变行为),换取治理安全。这是"改进速度"与"治理安全"的平衡点,且该平衡点可由业务侧调节——审批链的步数与角色本身可训练(治理之治理)。

14.8 本章小结