直接回答:大模型API的真实成本不是“输入单价+输出单价”这么简单。完整账单还可能包含缓存写入、缓存读取、思考Token、搜索或地图调用、代码执行、文件存储、长上下文阶梯价、批处理模式、失败重试和人工审核。最可靠的比较指标是每个成功任务的总成本。
数据与产品信息核验日期:2026年8月4日。模型、价格和排行榜会持续变化,实际使用前请再次查看官方页面。

核心计算公式
单次请求成本 = 未缓存输入Token × 输入价 + 缓存命中Token × 缓存读取价 + 缓存写入Token × 写入价 + 输出与思考Token × 输出价 + 工具调用费 + 存储费 + 其他附加费。
不同厂商的账单字段并不完全一致。有的把思考Token计入输出,有的区分缓存写入和命中,有的搜索工具按“请求”收费,还有的在超长输入后启用更高阶梯价。因此,不能只复制一列“每百万Token价格”就下结论。
API账单中常见的8类成本
| 成本项 | 含义 | 容易忽略的地方 |
|---|---|---|
| 未缓存输入 | 系统提示词、用户问题、文档、工具结果等 | 多轮对话会反复携带历史内容 |
| 缓存读取 | 重复前缀命中缓存后的输入 | 只有满足缓存规则和前缀稳定时才省钱 |
| 缓存写入 | 首次写入可复用上下文 | 部分平台写入价格高于普通输入 |
| 可见输出 | 最终返回给用户的文字或结构化数据 | 长回答的输出单价通常明显高于输入 |
| 思考Token | 模型内部推理或返回的推理内容 | 通常按输出价格计费,未必全部展示 |
| 工具调用 | 联网搜索、地图、代码执行、文件检索等 | 可能按查询、调用次数或容器时间收费 |
| 长上下文与存储 | 超长提示词、缓存存储时间、文件存储 | 部分模型超过阈值后整次请求升价 |
| 失败与重试 | 超时、格式错误、内容不合格后的再次调用 | 单价低但失败率高,最终可能更贵 |
截至2026年8月4日的官方价格示例
下表只用于展示不同计费结构,币种和能力层级不同,不能直接据此判断“谁最划算”。正式预算应以调用当天的官方控制台为准。
| 模型示例 | 未缓存输入 | 缓存读取 | 输出/思考 | 特别规则 |
|---|---|---|---|---|
| OpenAI GPT-5.6 Sol | 5美元/百万Token | 0.5美元/百万Token | 30美元/百万Token | 缓存写入按未缓存输入的1.25倍;输入超过272K时整次请求适用更高价格 |
| Claude Sonnet 5 | 促销期2美元,标准3美元/百万Token | 按官方缓存费率 | 促销期10美元,标准15美元/百万Token | 促销价截至2026年8月31日;思考与正文共用输出预算 |
| Gemini 3.5 Flash | 1.5美元/百万Token | 0.15美元/百万Token | 9美元/百万Token | 缓存另有按小时存储费;搜索与地图按查询计费;Batch通常为标准价的一半 |
| DeepSeek V4-Pro | 缓存未命中3元/百万Token | 0.025元/百万Token | 6元/百万Token | 人民币计价;支持思考和工具调用;价格可能调整 |
这些官方页面同时说明了一个重要事实:模型名称相同,处理模式也会改变成本。例如批处理可能便宜但不适合即时响应;优先处理更快但单价更高;长上下文可能触发阶梯价;搜索工具还会产生独立费用。[1][2][3][4]
不要直接用“每百万Token”比较中文任务
Token不是固定的字数单位。语言、标点、数字、代码、空格和模型分词器都会改变Token数量。即便两个模型标价相同,同一段中文在不同分词器中也可能产生不同Token数。
正确做法是选取真实样本,用各平台的Token计数接口或实际账单测量,而不是假设“一个汉字等于一个Token”。模型升级后也要重新计数;例如Claude Sonnet 5官方提醒,新分词器会让相同文本的Token数量发生变化。[2]
一个可复用的月度预算算法
假设一个客服摘要工作流每月调用10万次,每次平均包含:
- 固定系统提示词:1200 Token,可缓存;
- 用户与工单内容:800 Token,不可缓存;
- 最终摘要:300 Token;
- 其中80%的请求命中固定前缀缓存;
- 5%的结果需要重新调用一次。
则计算时应分别统计:
- 固定前缀:首次写入和未命中部分按写入或输入价计算,命中部分按缓存读取价计算;
- 动态输入:10万次 × 800 Token,再加5%重试;
- 输出:10万次 × 300 Token,再加重试产生的输出;
- 工具:如每10次调用一次搜索,则另加约1万次搜索费用;
- 人工:记录不能直接使用的结果需要多少审核和返工时间。
做预算表时,最好把请求量、平均输入、平均输出、缓存命中率、重试率、工具调用率都设成可修改变量,而不是写死一个“每月多少钱”的结论。
缓存为什么不一定省钱
适合缓存的情况
- 系统提示词长且稳定;
- 同一知识库或手册会被反复使用;
- 批量任务共享相同前缀;
- 请求间隔满足平台的缓存保留规则。
缓存收益不高的情况
- 每次提示词前部都变化,无法形成相同前缀;
- 缓存写入后只使用一次;
- 材料更新频繁,命中率很低;
- 为了命中缓存塞入大量无关内容,反而增加延迟和输出错误。
缓存是否值得使用,应看缓存命中Token占比 × 价格差 × 复用次数,同时减去写入和存储成本。
工具调用费用怎么核算
联网搜索通常不是“一次回答只收一次”。模型可能在一轮任务中发起多次查询;Google官方价格页明确说明,一次提交可能触发一个或多个搜索查询,并按实际查询计费。代码执行也可能按容器会话、运行时间或调用量收费。[3]
因此要从API响应或平台账单中记录:
- 每个任务触发了多少次搜索或工具调用;
- 工具结果又增加了多少输入Token;
- 工具失败是否引发重复调用;
- 检索结果是否真正提高了任务成功率。
真正公平的比较指标
每个成功任务成本 = 模型与工具总账单 ÷ 通过质量验收的任务数量。
进一步还可以计算:
- 每千次成功任务成本:适合客服、分类、抽取等高频场景;
- 每个合格代码修复成本:把失败运行、测试和人工审查都算进去;
- 每篇可发布内容成本:包括事实核查、编辑和退回重写;
- 每分钟节省的人工成本:判断API支出是否真正创造价值。
常见误区
- 只比较输入价:输出、思考和工具费用可能才是大头。
- 忽略模型分词差异:同样文字不一定消耗相同Token。
- 把缓存价当成所有输入价:实际命中率可能远低于预期。
- 混用美元和人民币:应在同一结算日期换算并考虑税费与渠道加价。
- 用单次演示估算生产成本:生产环境还存在重试、超时、峰值和审核。
常见问题
思考Token会收费吗?
多数主流API会把思考Token纳入输出计费,但展示方式不同。预算时应读取usage字段,而不是只数最终可见文字。
Batch为什么便宜?
批处理允许平台在更宽松的时间窗口内调度资源,适合离线任务,不适合需要立即回复的交互。
输入价格低的模型一定更省吗?
不一定。若输出更长、失败率更高或需要更多工具调用,单位成功任务成本可能更高。
多久重新核对一次价格?
上线前、模型版本变化时以及每月结算前都应核对。页面价格、促销期和缓存规则都可能调整。
参考资料
© 版权声明
文章版权归作者所有,未经允许请勿转载。