← 全部课程
实践课程6 课

让 AI 回答稳定到可以使用

看清上下文、定义验收、测试困难案例,并定位失败究竟来自输入、证据、指令、能力还是交接。

开课前准备

带着真实材料来,课程才会产生真实结果。

01 · 适合谁
适合 Prompt 在 Demo 中可用、面对真实输入却质量波动的团队。
02 · 准备什么
准备一条 Prompt、三个好结果和三个不理想结果。
03 · 如何结课
每个失败案例都能归入可处理的类别,而不是停留在模糊的“质量不好”。

适用场景

出现下面任一情况,就从这门课开始。

不需要先证明自己属于某个水平。只要当前工作出现对应信号,就带着真实材料进入;完成信号由课程验收决定。

AI VISTA / COURSE FIT让 AI 回答稳定到可以使用
  1. 01

    Demo 很好,真实输入却忽好忽坏

    你已经有一个能运行的版本,但质量会随文档、用户或格式变化。

  2. 02

    每次失败都只会继续改 Prompt

    团队没有区分上下文缺失、验收冲突、模型能力和流程交接。

  3. 03

    准备换模型,却缺少固定基线

    你需要同一组任务切片和失败标签来判断修改是否真的更好。

不适合从这里开始

如果当前问题是来源本身错误、权限不允许使用,或任务目标还没有定义清楚,应先回到任务界定或证据主题。

课程里程碑

每一段都要留下可以复核的变化。

里程碑不是新的课文清单。它用来判断你是否把前后课次连成同一项工作:起点有真实材料,中段有成形产物,结课有别人能够重复的证据。

  1. 01
    开始前

    先冻结当前版本,不要边学边改 Prompt。

    保存正在使用的 Prompt、三个满意输出、三个失望输出,以及产生它们的完整输入。它们是后续判断是否改善的基线。

    起点证据:每个好坏案例都能还原当时的上下文与输出。
  2. 02
    课程中段

    把质量问题拆成可定位的失败。

    画出上下文流向,写好验收契约,再建立覆盖真实任务切片的评测集。把遗漏、冲突、证据不足、能力边界和交接问题分开记录。

    中段证据:每条验收标准至少对应一个案例和一个失败标签。
  3. 03
    结课证明

    同一评测集重跑,并检查有没有换来新的退步。

    修复最主要的失败来源后,与冻结基线逐项比较;同时定义输入、依赖或人工改判变化时,什么时候需要重新评测。

    完成证据:改善来自明确改动,未通过案例有归因,漂移信号有负责人。
  1. 01
    第 1 课

    重写 Prompt 之前,先画清上下文

    把指令、资料、示例、历史、工具和输出规则拆开,先看清模型真正收到了什么。

    本课产物 · 上下文图
    未完成进入本课 →
  2. 02
    第 2 课

    先写验收契约,再写 Prompt

    在优化措辞之前,先定义必备字段、证据、语气、不确定性表达和拒收条件。

    本课产物 · 验收契约
    未完成进入本课 →
  3. 03
    第 3 课

    扩大投入前,先做一次 10 条案例试验

    用普通、困难、模糊和高风险案例组成一个足够小的测试集,把一次看起来不错的 Demo 变成可以复核的证据。

    本课产物 · 试验表
    未完成进入本课 →
  4. 04
    第 4 课

    建立一套会持续有用的 AI 评测集

    从真实任务中抽取切片、编写可复核参考、校准评分者并管理版本,让每次模型变更都能得到可信比较。

    本课产物 · 评测集蓝图
    未完成进入本课 →
  5. 05
    第 5 课

    换模型之前,先诊断回答为什么失败

    把坏答案定位到输入缺失、指令冲突、证据不足、能力边界或交接失败,而不是立刻换模型。

    本课产物 · 诊断树
    未完成进入本课 →
  6. 06
    第 6 课

    在漂移变成事故前监测 AI 工作流

    把任务构成、输入、依赖、结果和人工改判与明确基线对照,让每个告警都能触发可检查的响应。

    本课产物 · 漂移观察板
    未完成进入本课 →

结课验收

每个失败案例都能归入可处理的类别,而不是停留在模糊的“质量不好”。

不是读完就结束。把各课产物放在一起,请另一位同事按上面的标准复核。

01所有课次已完成
02产物放在同一份工作流里
03另一位同事完成复核
查看全部学习进度 →