返回课程目录
用权限、恢复和成本控制自动化第 5 课,共 7 课

用任务评分表选择模型,而不是追榜单

用真实工作流案例为质量、延迟、工具能力、隐私、恢复和运行约束设置权重。

本课完成物 · 选型评分表更新于 · 2026年9月8日
课程进度0 / 7
学习方式

先带着一个真实任务阅读,再完成页面中的工作台。能让另一位同事复核你的产物,才算完成本课。

脱离任务、运行环境和失败预算,“最好的模型”没有实际意义。一张任务评分表可以把选型从声誉竞赛变成可重复的工作流决策。

选型单位也不必是“整个产品只用一个模型”。抽取、判断、工具调用和最终表达可以有不同要求。评分表应该对应一个清楚的工作流步骤,并包含它前后的校验与后备路径。

先分开硬门槛和可权衡项

先写不能妥协的门槛,例如允许的数据地区、必须支持的接口、最长响应时间、结构化输出能力或部署限制。候选模型一旦未过门槛,就不能用更高的综合质量分补救。

再为可以权衡的因素设置权重:

  • 在真实案例上的正确性;
  • 遵守输出契约的稳定程度;
  • 工具调用可靠性;
  • 延迟分布,而不只是最快一次;
  • 每个完成任务的完整成本;
  • 隐私和数据保留方式是否合适;
  • 失败是否清楚、是否容易恢复;
  • 监控和更换所需的运行工作。

权重应该表达团队刻意选择的优先级,而不是被现成榜单的数据字段牵着走。

案例:客服工单分流

任务只输出类别、紧急程度和置信度。快速响应和稳定结构比长篇推理更重要;低置信度转人工,让较小模型也可能胜任。

一个解释写得很好、却偶尔破坏 schema 的候选,可能输给表达简单但稳定推动队列的模型。

案例:合同条款比较

工作流需要把条款与批准的规则手册对照,并同时引用双方文本。可追溯性、长上下文表现和保守表达不确定性更重要。速度虽有价值,但快速给出无依据的结论反而造成损失。

评分表可能为比较步骤选择能力更强的模型,同时把抽取和排版交给更便宜的模型或确定性程序。

测试完整工作流,而不是孤立 Prompt

评测要使用生产计划中的上下文组装、工具、校验器、重试规则和后备方案,并记录模型版本与配置。否则评分表衡量的是用户永远不会运行的实验室 Prompt。

同一案例应运行多次,保留每次结果,而不是只挑最好的一次。分别报告阻断性失败、通过情况、人工修改和任务完成成本。某个候选平均表现不错,却在同一输入上偶发越权动作,不应被一项综合分掩盖。

把超时、限流、无效结构、工具拒绝和无结果也记为工作流结果。只统计成功响应会系统性低估那些最影响真实使用的失败。

建立一张可复核评分表

先执行门槛,再计算偏好分:

评审区域记录方式
候选身份模型、版本、区域、配置和测试日期
硬门槛逐项通过或失败,并附验证证据
任务切片案例数量、风险和真实占比说明
质量规则与验收契约中的规则编号对应
稳定性重复运行之间的失败分布
运行指标端到端延迟、重试、工具和人工介入
成本每个完成任务而非单次请求的成本
恢复失败是否可见、可停止、可切换和可重放
决定选用范围、保留候选、未解决风险和复评触发

可权衡项可以使用统一的五级尺度,但每一级要有任务定义。例如结构稳定性中的 5 分可以表示“所有测试均通过 schema 与语义校验”,而不是评审者主观觉得很稳定。权重乘分数只用于整理证据,不应覆盖任何硬门槛。

处理并列与分工

当两个候选接近时,优先检查差异是否落在真正重要的切片。如果没有,就选择更容易监控、恢复与替换的方案,或者保留双候选做受控运行。不要为了制造唯一冠军而继续添加与任务无关的指标。

一个候选也可能只适合某一步。把高能力模型留给需要复杂证据比较的环节,用小模型处理低风险分类,或用确定性代码完成计算与格式校验。每次拆分都要重新计算端到端错误、延迟与成本,局部最优不一定让整条链路更好。

约定何时重新测试

模型版本、验收契约、资料集、工具或流量形态发生实质变化时再测。不要因为新模型发布就立即更换优胜者;只有任务证据变化,结论才需要变化。

常见问题

公开榜单完全没用吗? 它适合缩小候选范围和发现能力方向,但不能替代自己的输入、工具、权限、语言和失败门槛。

价格最低的模型成本一定最低吗? 不一定。应把重试、长输出、工具调用、失败恢复与人工修改计入每个完成任务的成本。

供应商更新同名模型后要不要重测? 只要实际版本或行为可能变化,就把它视作新候选;固定可固定的版本,并用相同评测集重新建立证据。

不适用边界

评分表让优先级透明,却不会消除判断。分数接近时应承认不确定性,在差异真正重要的案例上增加测试,并始终让已选模型保持可替换。

核验来源

这篇内容参考了哪些一手资料?

来源用于核对定义、风险边界或操作事实;判断框架和工作台由 AI Vista 独立编写。

  1. OpenAI Evals 指南核验于 2026-09-09
  2. NIST AI RMF Playbook核验于 2026-09-09

可带走的工具

场景化模型选型评分表

使用真实案例和明确权重。

model / scorecard
什么时候用准备把这项工作交给别人执行之前
填写后得到一份可填写、可交接、可复核的工作产物
使用顺序01—03
  1. 01
    写真实任务写这次要交付的结果,不写抽象目标。
  2. 02
    补齐判断字段把输入、风险、证据和接手方式写清楚。
  3. 03
    交给同事复核对方能复述结论,工具才算完成。
完成信号字段齐全,边界明确,可被复核。
编辑内容会自动保存

本课已读

完成工作台,再标记已读。

已读状态会更新课程目录与学习进度。

  1. 01字段齐全
  2. 02案例走过
  3. 03可以复核

文章讨论

读到这里,留下一个能被复用的判断。

记录哪一步有效、哪个边界不成立,或一个仍值得追问的问题。

正在讨论用任务评分表选择模型,而不是追榜单前往共学社区 →
0 条讨论观点 · 问题 · 建议