扩大投入前,先做一次 10 条案例试验
用普通、困难、模糊和高风险案例组成一个足够小的测试集,把一次看起来不错的 Demo 变成可以复核的证据。
先带着一个真实任务阅读,再完成页面中的工作台。能让另一位同事复核你的产物,才算完成本课。
一个成功样例只能证明流程曾经成功过一次。它不能说明成功比例、什么输入会让它失控,也不能说明人工复核是否已经抵消了节省的时间。十条经过选择的案例,往往比一百条顺手拿来的简单案例更能帮助决策。
用四类压力组成测试集
准备四条普通案例、两条困难案例、两条模糊案例,以及两条系统应该拒绝或转人工的案例。
- **普通案例:**日常最常见,也是建设流程的主要理由。
- **困难案例:**很长、噪声多、信息不完整或格式特殊,但仍属于任务范围。
- **模糊案例:**两位合理的复核者可能得出不同结论。
- **停止案例:**缺少权限、触碰禁止内容,或要求执行简报范围外的动作。
运行之前先写预期行为。否则,一份读起来顺畅的输出会悄悄改变团队原来的成功标准。
除了正确率,还要记录复核工作
每条案例记录通过或失败、原因、人工复核分钟数、重试次数,以及后备流程是否真的可用。一份需要十五分钟修改的答案可能在技术上正确,在运营上却没有价值。
关键失败单独记录,不要被平均分掩盖。即使总分很好,只要出现了禁止动作,也可能不能发布。
案例:发票字段提取
普通案例来自常用供应商的清晰发票;困难案例包含旋转扫描和多个税额;模糊案例包含贷项通知单与双语发票;停止案例来自无权限目录,或缺少必需的公司标识。
只有在字段能回到原文、模糊金额被标记、无权限文件被拒绝时,试验才通过。影响付款的字段不能用“十个字段对了九个”来掩盖。
案例:编辑提纲助手
普通案例有明确读者和资料包;困难案例包含互相矛盾的来源和严格字数;模糊案例只写“更有战略感”;停止案例要求在没有证据时补充结论,或复用受限制材料。
这里更重要的指标是复核时间和无依据结论,而不是每句话是否和编辑写得一样。只要不确定性清楚、来源完整,一份不完美的初稿也可能有用。
避免把 10 条案例挑成一场演示
先从任务简报里的输入范围抽取候选案例,再决定四类各占多少,不要看过模型输出后才给案例贴“困难”或“模糊”的标签。记录选择理由、原始来源、预期行为和不可接受失败;同一案例如果被修改,要保留旧版本,避免试验过程中悄悄降低难度。
运行前写一份短的发布规则:哪些失败会直接阻断继续,普通案例至少要表现到什么程度,复核总工作量最多能接受多少,停止案例应该出现什么交接状态。先锁定规则,才能防止团队因为喜欢某个流畅答案而改变门槛。
| 记录列 | 要回答的问题 | 容易遗漏的信号 |
|---|---|---|
| 预期行为 | 这条应该回答、拒绝还是转交? | 只写理想答案,不写正确的停止方式 |
| 实际结果 | 哪个字段、结论或动作发生变化? | 用“看起来不错”代替逐项记录 |
| 失败类型 | 来自输入、上下文、能力、工具还是交接? | 所有问题都归为 Prompt 不好 |
| 复核成本 | 人花了多久,改了什么? | 只计算模型调用,不计算人工修补 |
| 恢复结果 | 失败后任务是否仍能完成? | 转人工后丢失上下文、从头处理 |
同一配置只运行一次无法观察随机变化;重复运行所有案例又可能浪费。优先重跑会影响关键决定、曾经不稳定或刚被修复的案例,并记录配置、时间与依赖版本。试验的目标不是制造一个漂亮比例,而是让下一项投资决定有证据。
试验结束后只做四种决定
- **继续扩大:**普通案例稳定,困难案例能恢复,停止案例真的会停止。
- **缩小范围:**价值成立,但某类输入带来不成比例的失败或复核成本。
- **重新设计:**失败指向缺少上下文、验收不清或交接断裂。
- **停止投入:**输出无法低成本核验,或者后备流程不安全。
常见问题:10 条案例够不够?
为什么是 10 条,而不是更多?
10 条不是统计结论,而是一个迫使团队同时面对普通、困难、模糊和停止案例的最小工作格式。它适合早期筛选方案、暴露任务边界;如果要声明性能、比较接近的模型或开放高影响动作,必须扩展到能代表真实分布的评测。
十条里有一条失败还能继续吗?
先看失败性质。格式偏好可能进入修订队列;泄露受限内容、执行禁止动作或无法恢复的失败应直接阻断。发布规则必须在运行前写清,不能用总分掩盖关键失败。
什么时候把试验升级成正式评测集?
当团队已经确认任务值得继续,并需要比较版本、跟踪回归或决定生产门槛时,把试验案例归入稳定切片,补充真实频率、评分指南、复核者校准和版本记录。保留早期失败案例,它们通常是最有价值的回归测试。
不适用边界
十条案例是范围判断工具,不是生产保证。它的作用是决定这条流程是否值得更大、更有代表性的评测。在对外宣称表现之前,必须用真实分布替换方便的样例。
核验来源
这篇内容参考了哪些一手资料?
来源用于核对定义、风险边界或操作事实;判断框架和工作台由 AI Vista 独立编写。
- NIST《生成式人工智能风险管理框架画像》核验于 2026-09-09
- OpenAI Evals 指南核验于 2026-09-09
可带走的工具
10 条案例试验表
同时覆盖普通、困难、模糊和高风险输入。
- 01写真实任务写这次要交付的结果,不写抽象目标。
- 02补齐判断字段把输入、风险、证据和接手方式写清楚。
- 03交给同事复核对方能复述结论,工具才算完成。
本课已读
完成工作台,再标记已读。
已读状态会更新课程目录与学习进度。
- 01字段齐全
- 02案例走过
- 03可以复核
文章讨论
读到这里,留下一个能被复用的判断。
记录哪一步有效、哪个边界不成立,或一个仍值得追问的问题。
我给版本说明助手准备了 6 条普通案例、2 条混乱输入、1 条空变更记录和 1 条安全敏感案例。第 10 条让发布暂停了,但也明确告诉我该补哪条护栏。10 条有意设计的案例,比 50 条随机样例更有用。
还没有这篇文章的讨论。你可以留下第一条具体观察。