OpenAI API 怎么收费?GPT 各模型 token 单价与月成本估算
数据截至 2026-07,价格与限额以各官网为准。
OpenAI API 按 token 计费,输入和输出分开计价,输出通常比输入贵好几倍;真正决定账单大小的往往不是单价本身,而是你选的模型档位对不对、有没有用上缓存输入和批处理。这几件事做对了,同样的活儿成本能差出好几倍。
不少人一看到旗舰模型每百万 token 要几十美元就觉得吓人,其实这只是账单里的一个因子。这篇先把当前的计费规则和价格表捋一遍,再给一套能直接落地的省钱思路。
计费单位:按 token,输入输出分开算
OpenAI 的计费单位是 token,价格按每百万 token(也常写作每 1M token)标注,单位是美元。核心规则和大多数 API 服务一样:输入 token 和输出 token 分开计价,而且输出明显更贵。
输入 token 指的是你发过去的全部内容——系统提示词、历史对话、这一轮的用户消息,只要发过去了就算。输出 token 是模型这次生成回来的内容。如果你在做多轮对话,每一轮都把完整的历史消息重新发一遍,输入 token 就会随着对话轮数一路往上滚——这是很多人账单莫名其妙变高的主要原因,后面省钱部分会讲怎么应对。
这里还得先说一个 2026 年中的现状变化:截至 2026-07,官方定价页面已经不再展示 gpt-4.1、gpt-4o、o3、o1 这些旧模型的价格条目,主推的是 GPT-5.x 系列。如果你手里还有按 gpt-4o 价格估算成本的旧笔记,那份数字已经过时了,本文只按当前在售的模型给数字。
GPT-5.x 各模型单价表
下面是当前在售主力模型的单价(每百万 token,美元),只列已核实过的数字,未核实的档位标清楚,不替官方下结论:
| 模型 | 输入价 | 缓存输入价 | 输出价 | 上下文窗口 | 最大输出 |
|---|---|---|---|---|---|
| gpt-5.5(当前旗舰) | $5.00 | $0.50 | $30.00 | 1M | 128K |
| gpt-5.4(次旗舰) | $2.50 | $0.25 | $15.00 | 1M | 128K |
| gpt-5.4-mini(轻量款) | $0.75 | $0.075 | $4.50 | 400K | 128K |
| gpt-5.4-nano(最轻量) | $0.20 | $0.02 | $1.25 | 未核实/以官网为准 | 未核实/以官网为准 |
| gpt-5.5-pro | $30.00 | — | $180.00 | 未核实/以官网为准 | 未核实/以官网为准 |
| gpt-5.4-pro | $30.00 | — | $180.00 | 未核实/以官网为准 | 未核实/以官网为准 |
官方模型清单页实际列出的”前沿模型”只有 gpt-5.5、gpt-5.4、gpt-5.4-mini 这三个,上下文窗口分别是 1M/1M/400K,最大输出统一是 128K;nano 和 pro 两档虽然在定价页出现了价格,但没能在模型清单页交叉确认到上下文和最大输出的具体数字,所以老老实实标”未核实/以官网为准”,这两档如果你要用,务必自己上官网核实一遍再规划容量。
几点读表提示。第一,输出价基本是输入价的 6 倍左右(gpt-5.5 是 5/30,gpt-5.4-mini 是 0.75/4.5),比不少同类 API 的输出溢价幅度还要更明显一些,意味着控制输出长度对总价的影响比控制输入更立竿见影。第二,缓存输入价格全系都在标准输入价的十分之一左右(gpt-5.5 的 0.5 正好是 5.0 的十分之一,5.4-mini 的 0.075 也正好是 0.75 的十分之一),这个比例相当整齐,说明是官方统一设计的折扣规则,不是某个模型的特例。第三,pro 档明显是给追求极致质量、且不太在乎单价的场景准备的,日常任务没必要默认选它。
除了这条主线,官方还有几个专项模型顺带一提,方便你知道有这回事:gpt-realtime-2.1(实时语音/文本)音频输入价 $32/百万 token;gpt-image-2(图像生成)输入 $8、输出 $30,计价单位仍是每百万 token,但图像生成怎么换算成”每张图多少钱”官方给的机制比较特殊,建议自己上官网查一遍换算方式,本文不替官方做这个换算;sora-2(视频生成)是 $0.10/秒(720p)。这几个不是本文的重点,只列出来避免你以为 OpenAI 只有文本模型。
另外一个容易被忽略的背景信息:官方原文提到微调平台正在逐步关闭(“OpenAI is winding down the fine-tuning platform”),目前只剩 o4-mini-2025-04-16 一个还能微调的模型条目。如果你的成本规划里包含”微调后再批量调用”,这条路线目前官方入口在收窄,做决策前最好先确认这个模型条目是否还满足需求。
Batch API:不急的任务半价
如果任务不需要实时返回——比如离线批量打标、生成一批摘要、跑一次性的数据清洗——用 Batch API 异步提交,输入输出 token 都是标准价的 50%:
| 模型 | 输入价 | 缓存输入价 | 输出价 |
|---|---|---|---|
| gpt-5.5 | $2.50 | $0.25 | $15.00 |
| gpt-5.4 | $1.25 | $0.13 | $7.50 |
| gpt-5.4-mini | $0.375 | $0.0375 | $2.25 |
| gpt-5.4-nano | $0.10 | $0.01 | $0.625 |
这一档折扣不需要额外申请,就是同一套模型换一个提交方式,代价是结果不会秒回,需要异步轮询或等回调。对不急着看结果的批量任务来说,这基本是白捡的一半账单。
还有一条背景信息值得留意:2026-03-05 之后发布、支持”数据驻留”(data residency)的模型端点,会在标准价基础上额外收取 10% 上浮。如果你的合规要求必须选数据驻留端点,记得把这 10% 算进预算,别只按标准价表估算。
月成本怎么估算
给一个能直接套用的估算公式:
单次成本 = 输入 token 数 / 1,000,000 × 输入单价
+ 输出 token 数 / 1,000,000 × 输出单价
月成本 ≈ 单次成本 × 每月请求数
举个具体例子感受一下量级。假设你用 gpt-5.5 做一个客服问答功能,平均每次请求输入 2,000 token(系统提示加用户问题)、输出 500 token,每天 1,000 次请求:
- 单次输入成本:2,000 / 1,000,000 × $5.00 = $0.01
- 单次输出成本:500 / 1,000,000 × $30.00 = $0.015
- 单次合计:约 $0.025
- 每天 1,000 次:约 $25
- 一个月(30 天):约 $750
同样这套负载,如果换成 gpt-5.4-mini($0.75 输入 / $4.50 输出):
- 单次:2,000 / 1,000,000 × $0.75 + 500 / 1,000,000 × $4.50 = $0.0015 + $0.00225 = $0.00375
- 一个月:约 $112.5
两者相差将近 7 倍。这就是”选对档位”这件事的分量——很多分类、摘要、简单问答任务用 mini 甚至 nano 完全够用,非要默认上旗舰模型,纯粹是在多花冤枉钱。估算成本时的经验是:先拿一批真实样本量出平均输入输出 token 数,再乘以预期请求量,别凭感觉拍脑袋,token 数可以从 SDK 返回结果里的用量字段里直接读出来,比自己估算靠谱得多。
省钱调用法
单价这件事改不了,但下面几招能实打实压低账单,而且可以叠加使用。
一、用好缓存输入价格
前面表里能看到,缓存输入价格全系都在标准输入价的十分之一左右。如果你的请求里有一大段固定不变的内容——很长的系统提示词、参考文档、few-shot 示例——把这部分放在输入的前面、让它命中缓存,命中的部分就能按这个低得多的价格计费,只有真正变化的那一小段还按标准输入价算。
这里要诚实说一句:本文核实到的只是缓存输入这个”结果价格”,至于具体的缓存触发门槛(前缀要多长才会命中)、是否存在额外的缓存写入加价、缓存的有效期是多久,本次没能稳定核实到这些机制细节,如果你要精确利用这条规则,建议直接查官网关于 prompt caching 的说明页面,不要拿本文的数字去反推这些没确认过的机制。
二、Batch API:不急的活儿打五折
前面已经给了价格表,这里再强调一下适用场景:只要任务能接受异步返回——离线跑批、非实时的批量生成——就没理由不用 Batch API。同样的模型、同样的质量,账单直接减半,唯一的代价是等待时间从秒级变成异步轮询,对大多数后台任务来说这笔交易非常划算。
三、选对模型档位
这是最容易被忽略、但收益往往最大的一招,前面月成本的例子已经演示过一次:同样负载 gpt-5.5 换成 gpt-5.4-mini,差了将近 7 倍。实操上建议做分级路由——简单的分类、意图识别、短摘要交给 mini 甚至 nano;需要更强推理、但又要控制成本的生产批量走 gpt-5.4;只有真正复杂、容错率低的任务才上 gpt-5.5 或更高的 pro 档,别习惯性地一个旗舰模型打天下。
落地这套分级路由并不复杂:先用一个便宜模型或者简单规则判断这次请求的难度,简单的直接走 mini,拿不准或明显复杂的再往上升级到 5.4、5.5。不少团队实际统计后发现,真正需要旗舰模型的请求占比很小,绝大部分日常流量用中低档模型就够用,账单立刻就降下来了。评估阶段不妨多花点时间做一轮人工抽检,对比不同档位在你这个具体场景下的输出质量差异,这一次性投入换来的是长期每天都在省钱。
另外提醒一句,长对话场景要主动做历史裁剪:不要每一轮都把完整历史原样重发一遍,可以只保留最近几轮加一份滚动摘要,把早期对话压缩成很短的一段。这样输入 token 不会随对话轮数无限膨胀,配合缓存输入的低价一起用,效果更明显。
这几招是可以叠加算的:Batch 的五折可以和缓存输入的折扣、模型档位选择一起生效,组合下来的降幅往往比只用一招大得多,值得在项目规划阶段就一起设计进去,而不是等账单出来了再回头补救。
常见坑 / 注意
- 输出比输入贵约 6 倍:优化时优先控制输出长度,比一味压缩输入更有效。
- 长对话输入会滚雪球:每轮重发完整历史会让 token 越滚越多,考虑做历史裁剪或滚动摘要。
- 别再按 gpt-4o 估算:定价页已不展示旧模型,当前主力是 GPT-5.x 系列,旧笔记里的单价大概率过时了。
- nano/pro 的上下文和最大输出未核实:定价页有价格但清单页缺交叉确认,用之前自己上官网查一遍。
- 数据驻留端点有 10% 上浮:2026-03-05 后发布的支持数据驻留的模型端点,标准价基础上要多付一成。
- 缓存的触发门槛别瞎猜:本文只核实到缓存输入的价格,具体机制细节以官网 caching 说明页为准。
- 成本要实测别拍脑袋:用 SDK 返回结果里的用量字段量出真实 token 数,再乘请求量估月账。