大模型API价格怎么比较?输入、输出、缓存与工具调用成本计算

直接回答:大模型API的真实成本不是“输入单价+输出单价”这么简单。完整账单还可能包含缓存写入、缓存读取、思考Token、搜索或地图调用、代码执行、文件存储、长上下文阶梯价、批处理模式、失败重试和人工审核。最可靠的比较指标是每个成功任务的总成本

数据与产品信息核验日期:2026年8月4日。模型、价格和排行榜会持续变化,实际使用前请再次查看官方页面。

大模型API价格怎么比较?输入、输出、缓存与工具调用成本计算

核心计算公式

单次请求成本 = 未缓存输入Token × 输入价 + 缓存命中Token × 缓存读取价 + 缓存写入Token × 写入价 + 输出与思考Token × 输出价 + 工具调用费 + 存储费 + 其他附加费。

不同厂商的账单字段并不完全一致。有的把思考Token计入输出,有的区分缓存写入和命中,有的搜索工具按“请求”收费,还有的在超长输入后启用更高阶梯价。因此,不能只复制一列“每百万Token价格”就下结论。

API账单中常见的8类成本

成本项含义容易忽略的地方
未缓存输入系统提示词、用户问题、文档、工具结果等多轮对话会反复携带历史内容
缓存读取重复前缀命中缓存后的输入只有满足缓存规则和前缀稳定时才省钱
缓存写入首次写入可复用上下文部分平台写入价格高于普通输入
可见输出最终返回给用户的文字或结构化数据长回答的输出单价通常明显高于输入
思考Token模型内部推理或返回的推理内容通常按输出价格计费,未必全部展示
工具调用联网搜索、地图、代码执行、文件检索等可能按查询、调用次数或容器时间收费
长上下文与存储超长提示词、缓存存储时间、文件存储部分模型超过阈值后整次请求升价
失败与重试超时、格式错误、内容不合格后的再次调用单价低但失败率高,最终可能更贵

截至2026年8月4日的官方价格示例

下表只用于展示不同计费结构,币种和能力层级不同,不能直接据此判断“谁最划算”。正式预算应以调用当天的官方控制台为准。

模型示例未缓存输入缓存读取输出/思考特别规则
OpenAI GPT-5.6 Sol5美元/百万Token0.5美元/百万Token30美元/百万Token缓存写入按未缓存输入的1.25倍;输入超过272K时整次请求适用更高价格
Claude Sonnet 5促销期2美元,标准3美元/百万Token按官方缓存费率促销期10美元,标准15美元/百万Token促销价截至2026年8月31日;思考与正文共用输出预算
Gemini 3.5 Flash1.5美元/百万Token0.15美元/百万Token9美元/百万Token缓存另有按小时存储费;搜索与地图按查询计费;Batch通常为标准价的一半
DeepSeek V4-Pro缓存未命中3元/百万Token0.025元/百万Token6元/百万Token人民币计价;支持思考和工具调用;价格可能调整

这些官方页面同时说明了一个重要事实:模型名称相同,处理模式也会改变成本。例如批处理可能便宜但不适合即时响应;优先处理更快但单价更高;长上下文可能触发阶梯价;搜索工具还会产生独立费用。[1][2][3][4]

不要直接用“每百万Token”比较中文任务

Token不是固定的字数单位。语言、标点、数字、代码、空格和模型分词器都会改变Token数量。即便两个模型标价相同,同一段中文在不同分词器中也可能产生不同Token数。

正确做法是选取真实样本,用各平台的Token计数接口或实际账单测量,而不是假设“一个汉字等于一个Token”。模型升级后也要重新计数;例如Claude Sonnet 5官方提醒,新分词器会让相同文本的Token数量发生变化。[2]

一个可复用的月度预算算法

假设一个客服摘要工作流每月调用10万次,每次平均包含:

  • 固定系统提示词:1200 Token,可缓存;
  • 用户与工单内容:800 Token,不可缓存;
  • 最终摘要:300 Token;
  • 其中80%的请求命中固定前缀缓存;
  • 5%的结果需要重新调用一次。

则计算时应分别统计:

  1. 固定前缀:首次写入和未命中部分按写入或输入价计算,命中部分按缓存读取价计算;
  2. 动态输入:10万次 × 800 Token,再加5%重试;
  3. 输出:10万次 × 300 Token,再加重试产生的输出;
  4. 工具:如每10次调用一次搜索,则另加约1万次搜索费用;
  5. 人工:记录不能直接使用的结果需要多少审核和返工时间。

做预算表时,最好把请求量、平均输入、平均输出、缓存命中率、重试率、工具调用率都设成可修改变量,而不是写死一个“每月多少钱”的结论。

缓存为什么不一定省钱

适合缓存的情况

  • 系统提示词长且稳定;
  • 同一知识库或手册会被反复使用;
  • 批量任务共享相同前缀;
  • 请求间隔满足平台的缓存保留规则。

缓存收益不高的情况

  • 每次提示词前部都变化,无法形成相同前缀;
  • 缓存写入后只使用一次;
  • 材料更新频繁,命中率很低;
  • 为了命中缓存塞入大量无关内容,反而增加延迟和输出错误。

缓存是否值得使用,应看缓存命中Token占比 × 价格差 × 复用次数,同时减去写入和存储成本。

工具调用费用怎么核算

联网搜索通常不是“一次回答只收一次”。模型可能在一轮任务中发起多次查询;Google官方价格页明确说明,一次提交可能触发一个或多个搜索查询,并按实际查询计费。代码执行也可能按容器会话、运行时间或调用量收费。[3]

因此要从API响应或平台账单中记录:

  • 每个任务触发了多少次搜索或工具调用;
  • 工具结果又增加了多少输入Token;
  • 工具失败是否引发重复调用;
  • 检索结果是否真正提高了任务成功率。

真正公平的比较指标

每个成功任务成本 = 模型与工具总账单 ÷ 通过质量验收的任务数量。

进一步还可以计算:

  • 每千次成功任务成本:适合客服、分类、抽取等高频场景;
  • 每个合格代码修复成本:把失败运行、测试和人工审查都算进去;
  • 每篇可发布内容成本:包括事实核查、编辑和退回重写;
  • 每分钟节省的人工成本:判断API支出是否真正创造价值。

常见误区

  • 只比较输入价:输出、思考和工具费用可能才是大头。
  • 忽略模型分词差异:同样文字不一定消耗相同Token。
  • 把缓存价当成所有输入价:实际命中率可能远低于预期。
  • 混用美元和人民币:应在同一结算日期换算并考虑税费与渠道加价。
  • 用单次演示估算生产成本:生产环境还存在重试、超时、峰值和审核。

常见问题

思考Token会收费吗?

多数主流API会把思考Token纳入输出计费,但展示方式不同。预算时应读取usage字段,而不是只数最终可见文字。

Batch为什么便宜?

批处理允许平台在更宽松的时间窗口内调度资源,适合离线任务,不适合需要立即回复的交互。

输入价格低的模型一定更省吗?

不一定。若输出更长、失败率更高或需要更多工具调用,单位成功任务成本可能更高。

多久重新核对一次价格?

上线前、模型版本变化时以及每月结算前都应核对。页面价格、促销期和缓存规则都可能调整。

参考资料

  1. OpenAI GPT-5.6 Sol官方模型与价格页
  2. Anthropic Claude Sonnet 5官方说明与价格
  3. Google Gemini API官方价格
  4. DeepSeek API官方模型与价格
© 版权声明

相关文章