返回课程目录
完成第一条可验证的 AI 工作流第 4 课,共 4 课

扩大投入前,先做一次 10 条案例试验

用普通、困难、模糊和高风险案例组成一个足够小的测试集,把一次看起来不错的 Demo 变成可以复核的证据。

本课完成物 · 试验表更新于 · 2026年9月8日
课程进度0 / 4
学习方式

先带着一个真实任务阅读,再完成页面中的工作台。能让另一位同事复核你的产物,才算完成本课。

一个成功样例只能证明流程曾经成功过一次。它不能说明成功比例、什么输入会让它失控,也不能说明人工复核是否已经抵消了节省的时间。十条经过选择的案例,往往比一百条顺手拿来的简单案例更能帮助决策。

用四类压力组成测试集

准备四条普通案例、两条困难案例、两条模糊案例,以及两条系统应该拒绝或转人工的案例。

  • **普通案例:**日常最常见,也是建设流程的主要理由。
  • **困难案例:**很长、噪声多、信息不完整或格式特殊,但仍属于任务范围。
  • **模糊案例:**两位合理的复核者可能得出不同结论。
  • **停止案例:**缺少权限、触碰禁止内容,或要求执行简报范围外的动作。

运行之前先写预期行为。否则,一份读起来顺畅的输出会悄悄改变团队原来的成功标准。

除了正确率,还要记录复核工作

每条案例记录通过或失败、原因、人工复核分钟数、重试次数,以及后备流程是否真的可用。一份需要十五分钟修改的答案可能在技术上正确,在运营上却没有价值。

关键失败单独记录,不要被平均分掩盖。即使总分很好,只要出现了禁止动作,也可能不能发布。

案例:发票字段提取

普通案例来自常用供应商的清晰发票;困难案例包含旋转扫描和多个税额;模糊案例包含贷项通知单与双语发票;停止案例来自无权限目录,或缺少必需的公司标识。

只有在字段能回到原文、模糊金额被标记、无权限文件被拒绝时,试验才通过。影响付款的字段不能用“十个字段对了九个”来掩盖。

案例:编辑提纲助手

普通案例有明确读者和资料包;困难案例包含互相矛盾的来源和严格字数;模糊案例只写“更有战略感”;停止案例要求在没有证据时补充结论,或复用受限制材料。

这里更重要的指标是复核时间和无依据结论,而不是每句话是否和编辑写得一样。只要不确定性清楚、来源完整,一份不完美的初稿也可能有用。

避免把 10 条案例挑成一场演示

先从任务简报里的输入范围抽取候选案例,再决定四类各占多少,不要看过模型输出后才给案例贴“困难”或“模糊”的标签。记录选择理由、原始来源、预期行为和不可接受失败;同一案例如果被修改,要保留旧版本,避免试验过程中悄悄降低难度。

运行前写一份短的发布规则:哪些失败会直接阻断继续,普通案例至少要表现到什么程度,复核总工作量最多能接受多少,停止案例应该出现什么交接状态。先锁定规则,才能防止团队因为喜欢某个流畅答案而改变门槛。

记录列要回答的问题容易遗漏的信号
预期行为这条应该回答、拒绝还是转交?只写理想答案,不写正确的停止方式
实际结果哪个字段、结论或动作发生变化?用“看起来不错”代替逐项记录
失败类型来自输入、上下文、能力、工具还是交接?所有问题都归为 Prompt 不好
复核成本人花了多久,改了什么?只计算模型调用,不计算人工修补
恢复结果失败后任务是否仍能完成?转人工后丢失上下文、从头处理

同一配置只运行一次无法观察随机变化;重复运行所有案例又可能浪费。优先重跑会影响关键决定、曾经不稳定或刚被修复的案例,并记录配置、时间与依赖版本。试验的目标不是制造一个漂亮比例,而是让下一项投资决定有证据。

试验结束后只做四种决定

  • **继续扩大:**普通案例稳定,困难案例能恢复,停止案例真的会停止。
  • **缩小范围:**价值成立,但某类输入带来不成比例的失败或复核成本。
  • **重新设计:**失败指向缺少上下文、验收不清或交接断裂。
  • **停止投入:**输出无法低成本核验,或者后备流程不安全。

常见问题:10 条案例够不够?

为什么是 10 条,而不是更多?

10 条不是统计结论,而是一个迫使团队同时面对普通、困难、模糊和停止案例的最小工作格式。它适合早期筛选方案、暴露任务边界;如果要声明性能、比较接近的模型或开放高影响动作,必须扩展到能代表真实分布的评测。

十条里有一条失败还能继续吗?

先看失败性质。格式偏好可能进入修订队列;泄露受限内容、执行禁止动作或无法恢复的失败应直接阻断。发布规则必须在运行前写清,不能用总分掩盖关键失败。

什么时候把试验升级成正式评测集?

当团队已经确认任务值得继续,并需要比较版本、跟踪回归或决定生产门槛时,把试验案例归入稳定切片,补充真实频率、评分指南、复核者校准和版本记录。保留早期失败案例,它们通常是最有价值的回归测试。

不适用边界

十条案例是范围判断工具,不是生产保证。它的作用是决定这条流程是否值得更大、更有代表性的评测。在对外宣称表现之前,必须用真实分布替换方便的样例。

核验来源

这篇内容参考了哪些一手资料?

来源用于核对定义、风险边界或操作事实;判断框架和工作台由 AI Vista 独立编写。

  1. NIST《生成式人工智能风险管理框架画像》核验于 2026-09-09
  2. OpenAI Evals 指南核验于 2026-09-09

可带走的工具

10 条案例试验表

同时覆盖普通、困难、模糊和高风险输入。

pilot / table
什么时候用准备把这项工作交给别人执行之前
填写后得到一份可填写、可交接、可复核的工作产物
使用顺序01—03
  1. 01
    写真实任务写这次要交付的结果,不写抽象目标。
  2. 02
    补齐判断字段把输入、风险、证据和接手方式写清楚。
  3. 03
    交给同事复核对方能复述结论,工具才算完成。
完成信号字段齐全,边界明确,可被复核。
编辑内容会自动保存

本课已读

完成工作台,再标记已读。

已读状态会更新课程目录与学习进度。

  1. 01字段齐全
  2. 02案例走过
  3. 03可以复核

文章讨论

读到这里,留下一个能被复用的判断。

记录哪一步有效、哪个边界不成立,或一个仍值得追问的问题。

正在讨论扩大投入前,先做一次 10 条案例试验前往共学社区 →
1 条讨论观点 · 问题 · 建议
JP
Julian Park独立开发者
观点小型试验

我给版本说明助手准备了 6 条普通案例、2 条混乱输入、1 条空变更记录和 1 条安全敏感案例。第 10 条让发布暂停了,但也明确告诉我该补哪条护栏。10 条有意设计的案例,比 50 条随机样例更有用。

文章讨论16 有帮助