返回课程目录
完成第一条可验证的 AI 工作流第 3 课,共 4 课

在 AI 读取输入前,先画清数据边界

把每个字段分配到允许、变换、隔离或排除路径,避免一条有用的工作流悄悄变成失控的数据传递。

本课完成物 · 数据边界图更新于 · 2026年9月8日
课程进度0 / 4
学习方式

先带着一个真实任务阅读,再完成页面中的工作台。能让另一位同事复核你的产物,才算完成本课。

团队可能一致认为某条 AI 工作流很有用,却仍说不清模型究竟可以看到什么。“删掉个人信息”不是一个足够精确的答案:文档即使没有姓名,也可能保留账号、罕见事件,或一组能够重新指向某个人的细节。

因此,评审单位不应是整张数据表或整份文档,而应是每个会越过模型边界的字段、段落、附件和衍生信号。目标也不是把所有材料都宣称为匿名,而是在传递之前明确选择路径,并验证系统真的执行了这个选择。

先限定用途,再看哪些数据可用

先用一句话写清谁要使用什么输出。随后逐项追问:为了生成这个输出,哪些输入确实不可缺少?“数据库里正好有”和“以后也许有用”都不是发送理由。

对每个字段记录来源、原有使用权限、结果可见人、请求和回答会写入哪些日志,以及副本保留多久。自由文本和附件不能遗漏,它们往往藏着结构化字段没有呈现的细节。

还要记录可能产生的推断。邮编单独出现时可能风险有限,但与一种罕见事件组合后,就可能指向具体家庭。即使某项敏感信息不是输入列,只要模型能够从组合信息推断出来,它仍属于边界评审的一部分。

为每个字段选择四条路径之一

允许:原值对任务确有必要,使用权限明确,所选服务的实际配置也支持这种用法。批准只针对这个字段和这项任务,不自动延伸到相似数据。

变换:任务需要其中一部分信息,但不需要原始形态。可以把姓名改成稳定案例编号,把准确日期改成年龄区间,把完整文档改成审核过的摘录,把精确位置降为足够使用的区域。

隔离:敏感材料留在一个单独受控的步骤中。本地系统先提取获准事实,只把更小的结果交给后续模型。隔离步骤同样要有负责人、日志规则和失败后的处理方式。

排除:没有这个字段,工作流仍然可以产生有用结果,因此它从不进入 AI 链路。排除通常比传输之后的承诺更可靠。

路径必须逐字段决定。同一张客服工单可以允许产品型号、变换客户身份、隔离诊断附件,同时排除付款信息。

案例一:生成客服回复,但不暴露完整账户

客服团队希望为安装故障生成回复初稿。最初方案把完整工单和账户历史全部发送给模型。重新按输出需要审查后,团队发现初稿只需要产品版本、运行环境、报错文字、已经尝试的步骤和对应支持政策。

边界图允许版本与错误码;把客户姓名换成案例编号,把购买日期转换成“保修期内或外”;上传日志留在隔离的预处理环节,只提取批准的诊断片段;账单备注、街道地址以及无关历史对话全部排除。

验证也必须落到真实链路:在测试工单里植入容易辨认的禁止字段,运行实际流程,然后检查发送请求、应用日志、追踪记录、缓存和导出结果。只看界面上的 Prompt 预览并不足够,因为另一个环节可能仍保存着原始附件。

案例二:为招聘小组整理面试记录

面试记录既包含与岗位有关的证据,也可能夹杂不应影响决定的观察。如果把所有笔记交给摘要工具,后者可能继续保留甚至放大这些观察。

招聘团队先把输出限定为“依据公开岗位标准生成结构化对照”。候选人的工作实例和岗位问题回答可以进入;姓名变换成候选编号;联系方式、排期信息全部排除;受保护特征或与岗位无关的描述不进入流程。生成的比较结果只对获准评审成员开放,并沿用招聘材料既有的保留期限。

数据边界也约束输出:模型只能引用允许进入的证据;如果合规输入不足以支持某项判断,就保留为空,而不是补一个看似合理的猜测。

在数据真正流动的位置做验证

边界表如果没有测试,还只是一份意向。制作一条合成记录,为每个禁止字段放入独特标记,观察预处理后的请求、重试载荷、工具参数、遥测、错误报告、缓存和人工复核界面。随后删除这条记录,并逐一确认所有留存副本遵守既定规则。

任何例外都要写批准人和失效日期。没有负责人和期限的临时例外,会变成永久的隐藏通道。当任务、数据源、服务配置、日志系统或结果受众发生变化时,都要重新看边界图;不能只在更换模型时复核。

把边界决定连接到系统控制

一张字段表只有在实际链路里找到对应控制,才算完成。为每条“允许、变换、隔离、排除”决定补上执行位置和验证证据:入口校验拒绝什么,预处理删除或替换什么,模型请求最终包含什么,日志与缓存保留什么,结果页面又向谁展示什么。

路径最低控制发布前证据
允许字段白名单、用途和接收者固定抓取真实测试请求,确认只有批准字段
变换转换规则在发送前执行,失败默认停止用可识别标记证明原值没有进入下游
隔离独立身份、受限输出和明确删除方式检查隔离步骤只返回批准的衍生结果
排除入口即移除,不能依赖 Prompt 忽略请求、重试、遥测和导出均找不到字段

变更评审不能只问“是否换了模型”。新增数据源、扩展结果受众、打开调试日志、延长保留期限、增加工具调用,都会改变原来的边界。为边界图指定版本、负责人和下一次复核条件;每个例外写明原因、批准人、范围与自动失效日期。

数据脱敏后就可以自由使用吗?

不能。变换只是降低某些风险,任务用途、访问权限、组合推断和保留方式仍需单独判断。尤其是自由文本、截图和附件,表面上移除姓名并不代表无法重新识别。

能不能只在 Prompt 里要求模型忽略敏感字段?

不能把它当作数据控制。字段一旦进入请求,就已经越过边界;模型是否在回答中复述,只影响输出表现。真正的排除与变换必须发生在发送之前,并在重试、日志和工具参数中同样生效。

边界图多久更新一次?

采用事件触发比固定周期更可靠。任务、输入源、供应商配置、日志、工具、受众或保留方式一旦变化,先暂停扩大范围并复核受影响字段。固定周期可以作为兜底,但不能替代变更时检查。

不适用边界

数据边界图是工作流设计工具,不是法律结论,也不能替代正式安全评审。组织是否具备合法依据、合同授权、必要同意或合适的供应商协议,应由承担责任的隐私、法务、安全和数据负责人判断。

不要因为做了变换就声称数据不可能被重新识别。如果泄露或错误推断仍会造成严重伤害,应把材料留在工作流之外,或仅使用已经独立批准的受控环境。只要团队说不清负责人、保留期限或删除路径,当前决定就应是“排除”,直到这些事实被补齐。

核验来源

这篇内容参考了哪些一手资料?

来源用于核对定义、风险边界或操作事实;判断框架和工作台由 AI Vista 独立编写。

  1. NIST Privacy Framework核验于 2026-09-09
  2. NIST《人工智能风险管理框架》核验于 2026-09-09

可带走的工具

AI 数据边界图

在数据进入模型前,逐字段决定它可以走哪条路径。

data / boundary / map
什么时候用准备把这项工作交给别人执行之前
填写后得到一份可填写、可交接、可复核的工作产物
使用顺序01—03
  1. 01
    写真实任务写这次要交付的结果,不写抽象目标。
  2. 02
    补齐判断字段把输入、风险、证据和接手方式写清楚。
  3. 03
    交给同事复核对方能复述结论,工具才算完成。
完成信号字段齐全,边界明确,可被复核。
编辑内容会自动保存

本课已读

完成工作台,再标记已读。

已读状态会更新课程目录与学习进度。

  1. 01字段齐全
  2. 02案例走过
  3. 03可以复核

文章讨论

读到这里,留下一个能被复用的判断。

记录哪一步有效、哪个边界不成立,或一个仍值得追问的问题。

正在讨论在 AI 读取输入前,先画清数据边界前往共学社区 →
0 条讨论观点 · 问题 · 建议