在漂移变成事故前监测 AI 工作流
把任务构成、输入、依赖、结果和人工改判与明确基线对照,让每个告警都能触发可检查的响应。
先带着一个真实任务阅读,再完成页面中的工作台。能让另一位同事复核你的产物,才算完成本课。
AI 接口可能一直正常返回,周围工作流却一天比一天不可靠。客户开始提出不同问题,文档版式变化,检索来源停止更新,或者评审人员悄悄修改了更多输出。这些变化都不一定产生一次 HTTP 错误。
因此,监控需要一个说得清的参照,并从多个层面观察真实任务。目的不是把所有波动都叫作“漂移”,而是在变化足以影响决定时尽早发现,查看具体案例,定位受影响环节,再采取范围明确的动作。
建立有名称、会过期的基线
选择一个工作流版本、任务构成、资料来源和复核方式都相对清楚的时间段。记录起止日期、配置、评测集版本、已知事故和排除项。没有这些上下文,正常季节变化也会变成无法解释的告警。
信号要按有意义的任务切片计算,不能只看全站汇总。总体通过情况可能没有变化,其中一种语言、供应商格式、产品线或高风险动作却已经退化。评测、监控和事故复盘应使用相同切片名称,让证据能够在三个环节之间流动。
为基线设置失效日期或复核触发条件。促销、政策发布、新市场、上游改版、模型更新或工具变化,都可能让昨天的比较失去意义。替换基线要由明确负责人批准,并说明哪项变化从此被视为正常;否则团队只需移动参照,就能让问题从图表上消失。
同时观察五层变化
任务构成:人们是否开始带来不同工作?观察子类型、语言、风险等级,以及超出原任务定义的请求比例。
输入状态:包括文档长度、缺失字段、文件类型、图像质量、异常值和解析失败。除了图表,还应保留获准调查的代表案例。
依赖环节:包括模型与 Prompt 版本、检索覆盖、工具成功情况、权限、延迟、额度和上游字段变化。能够固定的版本要固定,无法固定的变化也要留下记录。
结果质量:直接检查验收契约,例如结论是否有证据、路由是否正确、字段是否有效、任务是否真正完成,以及是否出现有害失败。响应长度之类运行代理指标,除非任务明确要求,否则不能代表质量。
人工信号:包括修改、拒绝、升级、重新打开、投诉和绕开系统的手工操作。“原样批准”和“修改后批准”必须分开,否则看板可能显示成功,实际却是人在修补每一条结果。
让每个阈值都生成可调查任务
每个信号都要写清切片、比较窗口、阈值、最低样本量、负责人和第一响应。只有比例没有数量,可能因三个特殊案例过度反应;过大的滚动平均又可能发现太晚。必要时可以用一个快速提示配合较慢的确认窗口。
告警应附带变化前后的代表案例,以及配置与依赖差异。第一动作通常是缩小或暂停某个切片、增加复核、恢复上一版来源,或运行一组针对性评测。除非替代模型已经通过相同任务证据和恢复规则,不要让系统自动换模型。
持续记录告警直到关闭,并把原因归为新流量、输入破坏、依赖变化、评测盲区、评审行为或误报。这段历史可以改进阈值,也能暴露反复出现的薄弱环节。
案例一:新版发票悄悄破坏字段抽取
一个主要供应商更换了发票版式,抽取流程仍持续返回合法 JSON,完成状态和延迟都很正常。但这个供应商的采购单号空值开始增加,评审人员修改税额的次数也明显变多。
观察板设置了版式指纹这一输入信号、必填字段验收这一结果信号,以及金额字段修正这一人工信号,并全部按供应商切片。告警附上变化前后的小组样本,最终发现页脚中的一个数字被误当成税额。
响应不需要停止所有发票。团队只把这个供应商切换到强制复核,为其文档恢复上一版解析器,把新布局加入评测候选池,并测试修订后的抽取步骤。只有该切片重新通过发布门槛后,才恢复自动处理。
案例二:客服助手失去新功能资料
产品发布新功能,同时重组了文档目录。客服助手仍然可用,回答也很快;“是否返回了某条检索结果”这个指标几乎没变,但客服人员开始频繁重写与新功能有关的答案。
工作流监测“没有支持证据”的结果占比、各产品区域的文档版本覆盖、已退役页面的引用,以及人工重写原因。新功能切片越过改判阈值,附带案例显示索引任务漏掉了一个刚创建的文档区域。
团队先关闭这个切片的生成式答案,展示真实的人工转交状态,同时修复资料摄取。随后运行当前评测案例、验证引用支持,再重新开放。事故还促使依赖层新增索引覆盖检查;更换模型并不能补回缺失来源。
让观察板保持小而可执行
每层先保留一到两个真正影响决定的信号。每项指标都必须有人读取,也必须对应一个可能采取的动作。删除那些从不改变运行方式的装饰性数字。定期检查告警是否足够早、负责人是否响应、附带样本能否支持诊断。
还要把变化连接到发布记录。Prompt、模型、来源、工具或阈值发生变化时,在时间线上标注;建立新基线之前,先比较受影响切片。只有团队知道看板究竟在观察什么行为,“没有告警”才有意义。
填写一张漂移观察表
为每个真正需要监测的信号填写一行。空着的负责人或响应动作意味着它还不是一个可运行的监控项。
| 字段 | 示例写法 |
|---|---|
| 工作流与切片 | 发票抽取 / 供应商 A |
| 观察层 | 输入状态 |
| 信号定义 | 采购单号为空且原文件含该字段 |
| 当前基线 | 基线名称、日期范围与样本量 |
| 提示条件 | 短窗口异常,用于开始查看样本 |
| 行动条件 | 确认窗口异常,用于改变运行方式 |
| 调查材料 | 前后案例、版本差异、人工改判原因 |
| 第一响应 | 把该供应商切换为强制复核 |
| 负责人 | 有权执行第一响应的具体角色 |
| 恢复条件 | 针对性评测通过且连续窗口恢复 |
阈值不能从整齐的整数倒推。先查看基线的正常波动,再根据发现过晚的损失和误报成本决定提示与行动边界。低频但严重的越权操作不适合等待比例越线,单次发生就应触发事件流程。
为变化准备三级响应
观察适合证据不足的小幅变化:保留样本、核对埋点和版本,不改变用户路径。限制适合已影响某个切片但范围清楚的变化:增加人工复核、关闭特定动作或恢复某个依赖版本。停止用于违反安全门槛、无法确定影响范围或恢复机制失效的情况。
每一级都应写明谁能启动、谁能降级、最长保持多久,以及升级需要哪项新证据。这样告警到来时,值班人员无需临时争论“要不要全部关掉”,也不会因为害怕全局停机而放任局部问题继续扩大。
常见问题
模型版本没有变化,还会漂移吗? 会。真实任务、输入格式、检索资料、外部工具和人工复核标准都可能变化,端点稳定不能代表工作流稳定。
多少数据才可以设阈值? 没有通用样本数。记录分母与不确定性;低流量高影响流程采用逐案门槛,高流量流程再使用分切片窗口比较。
告警恢复正常就能自动关闭吗? 不能只看曲线回落。还要确认原因、完成对应修复、通过受影响切片的复测,并记录恢复运行的负责人和时间。
不适用边界
漂移监控不能替代验收测试、安全监控、事故响应或用户直接反馈。统计变化本身不能解释原因,汇总数字稳定也不能证明单个高影响决定安全。
不要为了调查方便而无限收集敏感生产内容,应使用获准样本、访问控制和保留期限。流量极低的工作流可能更适合逐案复核,而不是设置数值阈值。如果告警负责人没有权限暂停或缩小受影响操作,再增加一张图也不会产生控制;应先修复权限和恢复设计。
核验来源
这篇内容参考了哪些一手资料?
来源用于核对定义、风险边界或操作事实;判断框架和工作台由 AI Vista 独立编写。
- NIST AI RMF Playbook核验于 2026-09-09
- NIST《生成式人工智能风险管理框架画像》核验于 2026-09-09
可带走的工具
AI 工作流漂移观察板
让每个变化信号都连接到诊断方法与有边界的响应动作。
- 01写真实任务写这次要交付的结果,不写抽象目标。
- 02补齐判断字段把输入、风险、证据和接手方式写清楚。
- 03交给同事复核对方能复述结论,工具才算完成。
本课已读
完成工作台,再标记已读。
已读状态会更新课程目录与学习进度。
- 01字段齐全
- 02案例走过
- 03可以复核
文章讨论
读到这里,留下一个能被复用的判断。
记录哪一步有效、哪个边界不成立,或一个仍值得追问的问题。
还没有这篇文章的讨论。你可以留下第一条具体观察。