Codex 积分单价里的三个比例:缓存 10 倍、输出 6 倍、档位 25 倍

2026-08-09

Codex(OpenAI Codex)官方定价页里有一张积分单价表,三个模型、三列数字,一共九个格子。大部分人扫一眼就划过去了,因为绝对数字记不住,记住了也用不上——你不知道自己一个月会跑多少 token。

但这张表真正有用的不是绝对值,是列与列之间、行与行之间的比例。这三个比例是从官方数字直接除出来的,不需要任何额外假设,而且它们分别指向三个完全不同的动作。下面先把表摆出来,再一条条走决策路径。

一、先看原始表

官方给出的单位是 credits / 1M tokens(每 100 万 token 消耗多少积分):

模型InputCached InputOutput
GPT-5.6 Sol12512.5750
GPT-5.6 Terra505300
GPT-5.6 Luna50.530

(数据来自 ChatGPT 官方定价页,2026-08-09 核对,以官方为准。)

先把名字对齐,免得你抄完配置跑不起来:官方《Models》页里这三档的模型名原样是 gpt-5.6-solgpt-5.6-terragpt-5.6-luna(上面这张定价页表格里写作 GPT-5.6 Sol / GPT-5.6 Terra / GPT-5.6 Luna)。config.toml 的 model 键要填的是小写连字符的那一串。本文下文为了句子不啰嗦,会简称 sol / terra / luna,指的就是这三个完整原名,抄进配置文件时请写全。

官方另外给了一个经验值:GPT-5.6 平均每条消息 5–40 credits。注意这是个跨度八倍的区间,它是用来做量级感的,不是用来做预算的。

这里必须先说清一件事:credits 和货币之间怎么换算,官方这张表没给。所以本文不会出现任何”一个月大概花多少钱”的结论,也不会做汇率换算。这三个比例能告诉你的是同样一件事换个做法会差几倍,不是你会花多少。把它当账单预测器用,一定会算错。

二、比例一:缓存命中的输入,单价是十分之一

竖着看 Input 与 Cached Input 两列:125 → 12.5、50 → 5、5 → 0.5。三个模型都是十分之一,一个例外都没有。

这个比例有意思的地方在于跨行也成立:gpt-5.6-terra 的缓存输入是 5,正好等于 gpt-5.6-luna 的未缓存输入 5;而 gpt-5.6-sol 就算输入全部命中缓存(12.5),单价仍然是 luna 未缓存输入(5)的 2.5 倍。也就是说,“换个便宜档”和”让上下文可复用”是两个量级相当的杠杆,谁也不能替代谁。

需要克制的地方是:官方这张表只告诉你缓存命中便宜十倍,没有告诉你命中条件是什么。我手上这批官方材料里没有缓存命中规则,所以我不会写”把系统提示放最前面就一定命中”之类的话——那是推断,不是事实。你能确定的只有一条:让同一段上下文尽可能保持原样地反复使用,在账单上是直接可见的,值得为此调整工作方式;至于具体命中率,只能以官方最新说明为准。

配置侧和”输入量”直接相关的键,官方《Configuration Reference》里有这么几个:

说明
model_auto_compact_token_limit触发自动压缩历史的 token 阈值
model_auto_compact_token_limit_scope阈值统计范围,totalbody_after_prefix,默认 total
tool_output_token_limit存储工具输出的 token 预算
model_context_window当前模型可用的上下文 token 数

tool_output_token_limit 这个键值得单独点一句:官方把工具输出单列了一个 token 预算键,说明它是可以独立设上限、独立控制的一项开销,而不是只能跟着历史压缩阈值一起被动收缩。它与积分单价之间具体怎么挂钩,官方这张定价表没给,以官方文档为准。

三、比例二:输出比输入贵 6 倍

横着看 Input 与 Output:750/125、300/50、30/5,三档全是 6 倍

这条比例改变的是优化的优先级。很多人第一反应是”少让它读文件”,但按单价算,让模型少输出废话,比让它少读文件更省——同样一万 token,写出来的成本是读进去的六倍。如果这一万 token 的输入还命中了缓存,那么差距会拉到六十倍量级。

官方给了几个和输出详略相关的配置键:

取值
model_verbositylow / medium / high(GPT-5 Responses API 详略)
model_reasoning_summaryauto / concise / detailed / none
model_reasoning_effortminimal / low / medium / high / xhigh

但这里有两个坑,不说清楚会误导人:

第一,hide_agent_reasoning 这个键的作用是在 TUI 和 codex exec 输出里抑制推理内容的显示。它管的是你看不看得见,官方文档没有说它能省积分,所以我不会把它写成省钱开关。

第二,推理强度的档位名有两套。界面上的档位叫 Light/Low、Medium、High、Extra High,另有 Max(对单个问题启用扩展推理)和 Ultra(派生子代理并行处理);而 config.toml 里 model_reasoning_effort 接受的取值是 minimal/low/medium/high/xhigh这两套名字不是同一串字符串,官方也没给映射表,写配置时别照着界面名往里填。官方对推理强度给的原则很朴素:选够用的最低档。

四、比例三:三档之间差 25 倍,这是量级不是百分比

横向比三行:输入 125 vs 5,输出 750 vs 30,gpt-5.6-solgpt-5.6-luna 之间都是 25 倍。拆开看,sol 到 gpt-5.6-terra 是 2.5 倍,terra 到 luna 是 10 倍,两段乘起来正好 25。

25 倍意味着”要不要用 gpt-5.6-sol”这个决定的成本代价是量级级别的,不是省几个百分点。但也正因为是量级差距,它不该被单独拿来做决定——先得看你有没有的选。

五、决策路径:从你的处境倒推

第一问:这个活儿要不要在 Codex cloud 上跑?

如果要——选型这一步基本不用纠结了。官方《Models》页写得很明白:gpt-5.6-terra 在 Codex cloud 不可用,gpt-5.6-luna 在云端任务不可用,想让云端任务跑起来,落点只能是 gpt-5.6-sol。而且 Codex cloud 是自动选模型的,不是你本地选什么云端就用什么。这种情况下 25 倍那条比例对你没有操作空间,你能拧的只剩下前两条(少输出、让上下文可复用)。

如果不要云端,继续往下走。

第二问:任务是不是真的需要顶配?

官方《Models》页对三档的定位分别是:gpt-5.6-sol 是旗舰,面向复杂编码、computer use、研究与网络安全,能力 5 星、速度 2 星;gpt-5.6-terra 是均衡档,面向日常工作,性能对标 GPT-5.5 而成本更低,能力 4 星、速度 3 星;gpt-5.6-luna 是家族里最快最便宜的一档,能力 3 星、速度 4 星。(星级与定位为官方《Models》文档页口径,2026-08-09 核对。)

注意速度那一列——gpt-5.6-sol 是三档里速度星级最低的。所以选它的代价不只是 25 倍单价,还有等待时间。如果你的活儿是”改十个文件里的同一处拼写”,用 sol 属于两头亏。

第三问:预算卡在订阅还是卡在 token?

这两条计费线的口径完全不同,别混着算:

档位价格(官方原文)用量口径
Free$0/month
Go$8/month
Plus$20/month10–2,000 messages / 5h 窗口(随模型不同)
ProStarting at $100/month50–40,000 messages / 5h 窗口(随模型与档位不同)
API Key按 token 用量计费

(以上为 ChatGPT 官方定价页口径,2026-08-09 核对,以官方为准。)

Pro 这一档里,$100/month 档是 5 倍上限,$200/month 档是 20 倍上限,$200/month 档语音不限量,并含 gpt-5.3-codex-spark 研究预览——这是一款纯文本研究预览模型,只在桌面应用与 CLI 两个面上出现,且仅面向 ChatGPT Pro 用户。

订阅侧的计量单位是 messages(消息数),不是 token,也不是”次数”,窗口是 5 小时滚动窗口。Plus 的 10–2,000 和 Pro 的 50–40,000 跨度都极大,官方明确说这取决于模型(Pro 还取决于档位)。所以别把区间上限当成你能用多少,那是最好情况下的数字,不是承诺。

真正的分叉在这里:如果你走订阅,你的约束是”5 小时窗口内的消息数”,那么三个比例里最有用的是档位那条——用便宜档做简单活,等于把窗口里的消息数留给真正需要 gpt-5.6-sol 的那几条。如果你走 API Key 按 token 计费,那么缓存和输出这两条比例才是直接作用在账单上的。搞反了会做出错误的优化:在订阅制下拼命压缩输出长度,收益并不体现在窗口配额上。

关于限时活动:官方公告口径是,限时内 Codex 包含在 ChatGPT Free 与 Go 中,并且 Plus、Pro、Business、Enterprise、Edu 的速率上限翻倍,更高上限在 app、CLI、IDE、cloud 四个面上都适用。这是限时活动,不是常规权益,做长期预算时不能按翻倍后的额度规划。价格与活动随时可能调整,以官方页面为准。

企业侧:Business 是 $20/user/month(2 人起,年付;按月付为 $25/month),含桌面与移动端、更大的 VM、SAML SSO、MFA、管理控制,默认不用业务数据训练;Enterprise & Edu 为定制报价,需联系销售。(同为官方定价页口径,2026-08-09 核对。)

六、配置侧能拧的旋钮,以及一个别踩的

把上面几条落到 config.toml,大致是这样一段:

model = "gpt-5.6-terra"
model_reasoning_effort = "low"
model_verbosity = "low"
model_auto_compact_token_limit_scope = "total"

以上为按官方文档键位组合的示例,未逐项实测,以官方文档为准。

还有两个和”预算”字面相关但现在不该依赖的东西:features.rollout_budget.enabled 处于 under development 阶段,默认关闭。在 codex-cli 0.147.0(Windows 11)上执行 codex features list,可以看到 token_budget 的阶段是 under development、当前生效值是 false——阶段标签会随版本变,你自己那台机器上是什么状态,跑一次这条只读命令就知道,不要按别人文章里的截图假设。

service_tier 这个键的取值是 fast 或模型声明的档位;官方文档没有把它和积分单价挂钩,所以我不会说它能省钱。

七、这三个比例管不了什么

  • 管不了对错。 便宜 25 倍的档如果把活儿做砸了,返工的代价不在这张表里。表只能告诉你成本差几倍,告诉不了你哪一档够用。
  • 管不了权限。 “要不要让它改文件”是沙箱模式(read-only / workspace-write / danger-full-access)和审批策略的问题,跟选哪档模型是两条独立的线,别混在一次决策里想。
  • 管不了跨产品比价。 本文不和其它厂商的产品比单价——手头的官方材料里只有 Codex 这一张表,没有依据的维度不比。
  • 管不了月账单。 再说一次:credits 与货币的兑换关系官方这张表没给。任何”一个月大概多少钱”的算法都需要额外假设,一旦假设错了,结论就是错的。

真要落地,我的建议顺序是:先按”要不要云端”砍掉一半选项,再按任务复杂度和速度星级定档,最后才在选定的档位里去抠输出长度和上下文复用。反过来做——先花两天优化提示词长度,最后发现云端只能落到 gpt-5.6-sol——就白折腾了。

相关阅读


本文依据 Codex 官方文档(learn.chatgpt.com/docs/ 的《Pricing》《Models》《Configuration Reference》页面)整理,核对日 2026-08-09;文中标注「本机实测」的部分基于 codex-cli 0.147.0 / Windows 11 环境下的只读命令输出。产品功能、模型与价格以官方最新说明为准。价格与活动随时可能调整,下单前请以官方页面为准。桌面应用与云端部分为官方文档口径,非本机实测。

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。