先带着一个真实任务阅读,再完成页面中的工作台。能让另一位同事复核你的产物,才算完成本课。
脱离任务、运行环境和失败预算,“最好的模型”没有实际意义。一张任务评分表可以把选型从声誉竞赛变成可重复的工作流决策。
选型单位也不必是“整个产品只用一个模型”。抽取、判断、工具调用和最终表达可以有不同要求。评分表应该对应一个清楚的工作流步骤,并包含它前后的校验与后备路径。
先分开硬门槛和可权衡项
先写不能妥协的门槛,例如允许的数据地区、必须支持的接口、最长响应时间、结构化输出能力或部署限制。候选模型一旦未过门槛,就不能用更高的综合质量分补救。
再为可以权衡的因素设置权重:
- 在真实案例上的正确性;
- 遵守输出契约的稳定程度;
- 工具调用可靠性;
- 延迟分布,而不只是最快一次;
- 每个完成任务的完整成本;
- 隐私和数据保留方式是否合适;
- 失败是否清楚、是否容易恢复;
- 监控和更换所需的运行工作。
权重应该表达团队刻意选择的优先级,而不是被现成榜单的数据字段牵着走。
案例:客服工单分流
任务只输出类别、紧急程度和置信度。快速响应和稳定结构比长篇推理更重要;低置信度转人工,让较小模型也可能胜任。
一个解释写得很好、却偶尔破坏 schema 的候选,可能输给表达简单但稳定推动队列的模型。
案例:合同条款比较
工作流需要把条款与批准的规则手册对照,并同时引用双方文本。可追溯性、长上下文表现和保守表达不确定性更重要。速度虽有价值,但快速给出无依据的结论反而造成损失。
评分表可能为比较步骤选择能力更强的模型,同时把抽取和排版交给更便宜的模型或确定性程序。
测试完整工作流,而不是孤立 Prompt
评测要使用生产计划中的上下文组装、工具、校验器、重试规则和后备方案,并记录模型版本与配置。否则评分表衡量的是用户永远不会运行的实验室 Prompt。
同一案例应运行多次,保留每次结果,而不是只挑最好的一次。分别报告阻断性失败、通过情况、人工修改和任务完成成本。某个候选平均表现不错,却在同一输入上偶发越权动作,不应被一项综合分掩盖。
把超时、限流、无效结构、工具拒绝和无结果也记为工作流结果。只统计成功响应会系统性低估那些最影响真实使用的失败。
建立一张可复核评分表
先执行门槛,再计算偏好分:
| 评审区域 | 记录方式 |
|---|---|
| 候选身份 | 模型、版本、区域、配置和测试日期 |
| 硬门槛 | 逐项通过或失败,并附验证证据 |
| 任务切片 | 案例数量、风险和真实占比说明 |
| 质量规则 | 与验收契约中的规则编号对应 |
| 稳定性 | 重复运行之间的失败分布 |
| 运行指标 | 端到端延迟、重试、工具和人工介入 |
| 成本 | 每个完成任务而非单次请求的成本 |
| 恢复 | 失败是否可见、可停止、可切换和可重放 |
| 决定 | 选用范围、保留候选、未解决风险和复评触发 |
可权衡项可以使用统一的五级尺度,但每一级要有任务定义。例如结构稳定性中的 5 分可以表示“所有测试均通过 schema 与语义校验”,而不是评审者主观觉得很稳定。权重乘分数只用于整理证据,不应覆盖任何硬门槛。
处理并列与分工
当两个候选接近时,优先检查差异是否落在真正重要的切片。如果没有,就选择更容易监控、恢复与替换的方案,或者保留双候选做受控运行。不要为了制造唯一冠军而继续添加与任务无关的指标。
一个候选也可能只适合某一步。把高能力模型留给需要复杂证据比较的环节,用小模型处理低风险分类,或用确定性代码完成计算与格式校验。每次拆分都要重新计算端到端错误、延迟与成本,局部最优不一定让整条链路更好。
约定何时重新测试
模型版本、验收契约、资料集、工具或流量形态发生实质变化时再测。不要因为新模型发布就立即更换优胜者;只有任务证据变化,结论才需要变化。
常见问题
公开榜单完全没用吗? 它适合缩小候选范围和发现能力方向,但不能替代自己的输入、工具、权限、语言和失败门槛。
价格最低的模型成本一定最低吗? 不一定。应把重试、长输出、工具调用、失败恢复与人工修改计入每个完成任务的成本。
供应商更新同名模型后要不要重测? 只要实际版本或行为可能变化,就把它视作新候选;固定可固定的版本,并用相同评测集重新建立证据。
不适用边界
评分表让优先级透明,却不会消除判断。分数接近时应承认不确定性,在差异真正重要的案例上增加测试,并始终让已选模型保持可替换。
核验来源
这篇内容参考了哪些一手资料?
来源用于核对定义、风险边界或操作事实;判断框架和工作台由 AI Vista 独立编写。
- OpenAI Evals 指南核验于 2026-09-09
- NIST AI RMF Playbook核验于 2026-09-09
可带走的工具
场景化模型选型评分表
使用真实案例和明确权重。
- 01写真实任务写这次要交付的结果,不写抽象目标。
- 02补齐判断字段把输入、风险、证据和接手方式写清楚。
- 03交给同事复核对方能复述结论,工具才算完成。
本课已读
完成工作台,再标记已读。
已读状态会更新课程目录与学习进度。
- 01字段齐全
- 02案例走过
- 03可以复核
文章讨论
读到这里,留下一个能被复用的判断。
记录哪一步有效、哪个边界不成立,或一个仍值得追问的问题。
还没有这篇文章的讨论。你可以留下第一条具体观察。