开课前准备
带着真实材料来,课程才会产生真实结果。
- 01 · 适合谁
- 适合 Prompt 在 Demo 中可用、面对真实输入却质量波动的团队。
- 02 · 准备什么
- 准备一条 Prompt、三个好结果和三个不理想结果。
- 03 · 如何结课
- 每个失败案例都能归入可处理的类别,而不是停留在模糊的“质量不好”。
适用场景
出现下面任一情况,就从这门课开始。
不需要先证明自己属于某个水平。只要当前工作出现对应信号,就带着真实材料进入;完成信号由课程验收决定。
- 01✓
Demo 很好,真实输入却忽好忽坏
你已经有一个能运行的版本,但质量会随文档、用户或格式变化。
- 02✓
每次失败都只会继续改 Prompt
团队没有区分上下文缺失、验收冲突、模型能力和流程交接。
- 03✓
准备换模型,却缺少固定基线
你需要同一组任务切片和失败标签来判断修改是否真的更好。
课程里程碑
每一段都要留下可以复核的变化。
里程碑不是新的课文清单。它用来判断你是否把前后课次连成同一项工作:起点有真实材料,中段有成形产物,结课有别人能够重复的证据。
- 01 开始前↓
先冻结当前版本,不要边学边改 Prompt。
保存正在使用的 Prompt、三个满意输出、三个失望输出,以及产生它们的完整输入。它们是后续判断是否改善的基线。
起点证据:每个好坏案例都能还原当时的上下文与输出。 - 02 课程中段↓
把质量问题拆成可定位的失败。
画出上下文流向,写好验收契约,再建立覆盖真实任务切片的评测集。把遗漏、冲突、证据不足、能力边界和交接问题分开记录。
中段证据:每条验收标准至少对应一个案例和一个失败标签。 - 03 结课证明✓
同一评测集重跑,并检查有没有换来新的退步。
修复最主要的失败来源后,与冻结基线逐项比较;同时定义输入、依赖或人工改判变化时,什么时候需要重新评测。
完成证据:改善来自明确改动,未通过案例有归因,漂移信号有负责人。
- 01✓第 1 课
重写 Prompt 之前,先画清上下文
把指令、资料、示例、历史、工具和输出规则拆开,先看清模型真正收到了什么。
本课产物 · 上下文图未完成进入本课 → - 02✓第 2 课
先写验收契约,再写 Prompt
在优化措辞之前,先定义必备字段、证据、语气、不确定性表达和拒收条件。
本课产物 · 验收契约未完成进入本课 → - 03✓第 3 课
扩大投入前,先做一次 10 条案例试验
用普通、困难、模糊和高风险案例组成一个足够小的测试集,把一次看起来不错的 Demo 变成可以复核的证据。
本课产物 · 试验表未完成进入本课 → - 04✓第 4 课
建立一套会持续有用的 AI 评测集
从真实任务中抽取切片、编写可复核参考、校准评分者并管理版本,让每次模型变更都能得到可信比较。
本课产物 · 评测集蓝图未完成进入本课 → - 05✓第 5 课
换模型之前,先诊断回答为什么失败
把坏答案定位到输入缺失、指令冲突、证据不足、能力边界或交接失败,而不是立刻换模型。
本课产物 · 诊断树未完成进入本课 → - 06✓第 6 课
在漂移变成事故前监测 AI 工作流
把任务构成、输入、依赖、结果和人工改判与明确基线对照,让每个告警都能触发可检查的响应。
本课产物 · 漂移观察板未完成进入本课 →
结课验收
每个失败案例都能归入可处理的类别,而不是停留在模糊的“质量不好”。
不是读完就结束。把各课产物放在一起,请另一位同事按上面的标准复核。