算清一条 AI 工作流的完整成本
不要只比较 token 单价,把输入、输出、重试、工具、等待、复核和失败恢复一起算进去。
先带着一个真实任务阅读,再完成页面中的工作台。能让另一位同事复核你的产物,才算完成本课。
Token 价格只是工作流账单中的一行。实际支出还包括重复上下文、生成内容、重试、搜索、外部工具、等待、人工复核和失败恢复。真正可比的单位是“完成一项合格任务的成本”。
先定义“完成”和“合格”。如果一个回答生成后还要人工重写,或者工具执行失败却被计为成功调用,任何单位成本都会失真。成本图必须使用与验收契约相同的完成状态。
画出七条成本泳道
- **输入:**系统规则、资料、历史记录和每次重复发送的上下文。
- **输出:**用户看到的答案,以及隐藏的计划或中间生成。
- **重试:**自动重试、用户重新生成和修复调用。
- **工具:**搜索、数据库、浏览器、沙箱和付费接口。
- **等待:**持续占用的基础设施,以及用户等待时间。
- **复核:**接受或纠正结果所需的人工分钟数。
- **失败:**退款、事故处理、回退和被放弃的任务。
用真实任务频率和完成率计算每条泳道。一次调用虽然便宜,如果验收率很低,每个可用结果反而可能比昂贵但一次完成的调用成本更高。
可以用下面的关系统一比较:
每项合格任务成本 =(该批模型 + 工具 + 基础设施 + 人工 + 失败处理成本)÷ 该批最终通过验收的任务数
分母不能使用请求数、模型成功响应数或“没有报错”的任务数。若某批次没有任何任务通过验收,应直接标记为无法交付,而不是用零或空值掩盖结果。
案例:文档审阅
流程 A 每次提问都发送整份文档,并生成很长的回答。流程 B 只检索少量相关段落,返回简洁比较并附引用。B 增加了检索费用,却减少重复输入和复核时间。
谁更划算取决于文档大小、提问频率、检索准确度和复核人员成本,而不是单独的模型标价。
案例:自主研究
Agent 多次搜索、打开网页、重试受阻来源、写笔记并组合报告。最终写作调用只占整次运行的一小部分,工具调用、长时间等待、重复探索和来源核验才是主要成本。
限制搜索分支,并要求浏览前先列证据计划,往往比替换最终写作模型更能降低成本。
优先优化最大且可控制的一项
抽取一批真正完成的任务,移除重复上下文、限制无效循环、缓存稳定事实、缩短输出、改善路由,或把确定性步骤移出模型。每次改变后重新计算验收率和复核时间。
如果节省调用费用却增加了失败,只是把成本移动到了另一条泳道。
填写一张工作流成本记录
按任务运行保存原始量,再由规则换算金额或时间价值:
| 成本字段 | 应记录的原始量 |
|---|---|
| 任务与切片 | 任务类型、输入等级、风险和结果状态 |
| 模型调用 | 模型版本、输入输出量、调用次数和缓存命中 |
| 工具调用 | 工具名称、次数、计费单位、失败与重试 |
| 等待 | 端到端耗时、排队和人工等待 |
| 人工复核 | 角色、分钟数、原样通过或修改后通过 |
| 失败处理 | 恢复、补偿、重新联系和事故工时 |
| 最终状态 | 合格、拒收、放弃或仍待处理 |
金额、工资和工具价格应保存适用日期与币种。对无法货币化但影响决策的项目,例如用户等待或高风险错误,单独展示,不要为了得到一个整齐总数就随意估价。
比较改造方案,而不是只看账单
先建立同一任务切片的基线,再一次改变一个环节。压缩上下文可能降低输入成本,却也可能删掉决定性证据;减少人工复核可能缩短等待,却让失败处理上升;增加一个便宜的分类步骤可能避免大量昂贵调用,也可能因为误路由损失质量。
为每个方案同时比较合格任务成本、阻断性失败、完成时间和人工改判。若任务构成或验收规则变了,就不能把前后裸数字当作同一基线。把节省来自哪个泳道、代价转移到哪里写进决策记录。
容量与预算保护
成本地图还应转成运行边界:每项任务最多调用次数、工具分支数量、输出长度、等待时间和允许的人工接管。达到边界时,工作流应停止、缩小任务或请求批准,而不是在后台无限继续。
预算告警要附带任务编号与主要成本泳道,才能判断是异常循环、资料突然变长、工具涨价还是复核积压。只有一条总额通知无法指导恢复。
常见问题
怎样给人工时间定价? 选用组织认可的统一口径并注明假设;比较方案时同时保留分钟数,以免工资口径变化掩盖实际工作量。
缓存一定能省钱吗? 只有缓存内容稳定、命中真实重复且失效规则可靠时才算节省。错误或过期缓存带来的返工应进入失败泳道。
成本更低就应该上线吗? 不应该。所有候选先通过质量、安全和权限门槛;成本只在可接受方案之间参与取舍。
不适用边界
这张图服务于产品决策,不是会计准则。只纳入对当前工作流重要的成本,并明确哪些项目没有计算。当流量形态、模型行为、复核策略或工具价格变化时,重新绘制。
核验来源
这篇内容参考了哪些一手资料?
来源用于核对定义、风险边界或操作事实;判断框架和工作台由 AI Vista 独立编写。
- NIST AI RMF Playbook核验于 2026-09-09
- NIST《生成式人工智能风险管理框架画像》核验于 2026-09-09
可带走的工具
AI 工作流完整成本图
按每项合格完成任务计算成本。
- 01写真实任务写这次要交付的结果,不写抽象目标。
- 02补齐判断字段把输入、风险、证据和接手方式写清楚。
- 03交给同事复核对方能复述结论,工具才算完成。
本课已读
完成工作台,再标记已读。
已读状态会更新课程目录与学习进度。
- 01字段齐全
- 02案例走过
- 03可以复核
文章讨论
读到这里,留下一个能被复用的判断。
记录哪一步有效、哪个边界不成立,或一个仍值得追问的问题。
还没有这篇文章的讨论。你可以留下第一条具体观察。