评测与诊断
需要什么证据,才值得扩大这条工作流?
把对 AI 质量的感觉,变成有代表性的案例、验收检查、失败分类和另一位复核者能够重现的发布判断。
AI VISTA / DECISION01 / 03
当前判断既测试普通情况,也测试难处理的情况;修复失败来源,而不是最显眼的症状。
01输入
02验收
03边界
带回真实任务复核✓
判断分支
不要从工具名开始。
- 先问↓
缺的是事实、标准,还是模型能力?
- 如果↓
结果可核验且出错代价受控,再扩大自动化。
- 否则✓
缩小动作范围,保留人工交接和恢复路径。
完整案例
会议纪要看起来流畅,却经常写错负责人。
团队觉得纪要“基本可用”,但没有记录漏项、误归属、虚构截止日期和表达风格分别出现多少次,导致每次改动都靠印象判断。
最终产物一份带案例分层、失败标签、严重度和复核者意见的评测集蓝图。
01错误捷径
挑十段清晰录音,让同一个人按整体感觉打一个平均分;分数提高就认为可以扩大使用。
02更好的判断
从真实会议中分层抽取普通、多人打断、责任不清和敏感决策案例;把事实错误、缺失、归属错误与格式问题分开计数。
03如何验收
关键决定不得虚构负责人或日期;所有行动项能回到原话位置;两位复核者对是否通过的判断达到事先约定的一致标准。
进入与离开信号
知道何时进入,也要知道什么时候已经足够。
主题页不是无限深入的知识目录。进入信号帮助你判断当前问题是否属于这一层;完成信号用来决定是否继续下一主题,而不是用阅读时长代替成果。
01从这里进入
- 团队只用整体感觉判断质量
- 改动前后使用了不同案例
- 评测分数无法说明哪类风险仍存在
02达到这些信号后离开
- 真实任务切片与边界案例都有覆盖
- 失败类型、严重度和复核规则可重复
- 同一评测集能比较基线与新版本
不适用边界
这个主题页不会替你做什么?
评测集是发布决策的证据,不是统计学意义上的质量保证;高风险场景仍需领域负责人复核。
01不要用一个平均分掩盖关键失败02不要只测演示案例而跳过拒答和边界03没有可重复的复核标准,就不要宣称质量提升
当失败类别、严重度和处理动作稳定可复现,就进入证据、权限或运行主题。