GLM API 价格怎么算?智谱各模型 token 单价、分段定价与省钱用法
数据截至 2026-08-09,价格与限额以各官网为准。本次更新用浏览器渲染了官方定价页,拿到了此前抓不到的完整价目表。
智谱 GLM 的计费结构在这一版有两个必须重讲的变化:一是它已经不是”一口价”了,旗舰款全部改成按输入长度(部分还看输出长度)分段计价;二是缓存命中价成了价目表里的独立一列,力度大概是标价的四分之一。至于省钱,路子没变——GLM-4.7-Flash 依然长期免费,先拿它把链路跑通,量上去了再挑档位。
这篇的上一版写得非常保守:因为官网定价页是前端 JS 渲染的,抓取工具只能拿到一个空壳,所以当时全文只敢确认 GLM-4.5 一个型号的价格,其余全部标成”未核实”。这次重核换了方法——直接用浏览器把页面渲染出来再读,完整价目表拿到了。所以这一版不再有那一长串留白,下面的数字都是官方定价页上的逐字原文。
先说结构变化:GLM 现在是分段计价了
如果你对 GLM 的印象还停留在”输入 0.8 元、输出 2 元,简单明了”,那个印象需要更新了。现在官方旗舰价目表里,除了最新的 GLM-5.2 和免费档,其余型号都按单次请求的输入长度分档,GLM-4.7 和 GLM-4.5-Air 甚至还要再看输出长度。
这个变化对估算成本的影响不小:同一个模型,你发一个短 prompt 和发一个塞了整份文档的长 prompt,落进的档位不一样,单价也不一样。所以”GLM 多少钱一百万 token”这个问题,现在已经没法用一个数字回答了,得先问”你这次请求输入多长”。
另外一个容易搞反的地方:官方旗舰价目表现在的表头单位是每百万 tokens,跟主流平台对齐了。旧版本文章提醒过”官方是按千 tokens 报价、横评时别把单位搞反”,这条提醒现在对旗舰表已经不适用了——但页面下方”模型推理”板块里那批更早的 GLM-4 系列型号仍在,口径不一定跟旗舰表一致,如果你要用那批老型号,单位还是自己确认一眼更稳妥。
各模型单价表:这次是官方逐字数字
以下全部来自 bigmodel.cn/pricing 旗舰模型价目表,单位元/百万 tokens,档位里的数字是千 token(比如”[0,32)“指输入不到 32K token):
| 模型 | 档位 | 输入 | 输出 | 缓存命中 |
|---|---|---|---|---|
| GLM-5.2(新品) | 1M 全量 | 8 元 | 28 元 | 2 元 |
| GLM-5.1 | 输入 [0,32) | 6 元 | 24 元 | 1.3 元 |
| GLM-5.1 | 输入 [32+) | 8 元 | 28 元 | 2 元 |
| GLM-5-Turbo | 输入 [0,32) | 5 元 | 22 元 | 1.2 元 |
| GLM-5-Turbo | 输入 [32+) | 7 元 | 26 元 | 1.8 元 |
| GLM-5 | 输入 [0,32) | 4 元 | 18 元 | 1 元 |
| GLM-5 | 输入 [32+) | 6 元 | 22 元 | 1.5 元 |
| GLM-4.7 | 输入 [0,32) 且输出 [0,0.2) | 2 元 | 8 元 | 0.4 元 |
| GLM-4.7 | 输入 [0,32) 且输出 [0.2+) | 3 元 | 14 元 | 0.6 元 |
| GLM-4.7 | 输入 [32,200) | 4 元 | 16 元 | 0.8 元 |
| GLM-4.5-Air | 输入 [0,32) 且输出 [0,0.2) | 0.8 元 | 2 元 | 0.16 元 |
| GLM-4.5-Air | 输入 [0,32) 且输出 [0.2+) | 0.8 元 | 6 元 | 0.16 元 |
| GLM-4.5-Air | 输入 [32,128) | 1.2 元 | 8 元 | 0.24 元 |
| GLM-4.7-FlashX | 200K | 0.5 元 | 3 元 | 0.1 元 |
| GLM-4.7-Flash | 200K | 免费 | 免费 | 免费 |
几个读表要点:
缓存命中价大约是标价的两成。把每一行的命中价除以输入价,比例几乎都落在 20%-25% 之间(GLM-5.2 是 2÷8=25%,GLM-4.7 最低档是 0.4÷2=20%)。这个折扣力度比 DeepSeek 那种降到 1%-2% 的要温和得多,横评时别把两家的”缓存折扣”混为一谈——不是一个数量级。另外缓存存储费目前标注为”限时免费”,也就是说现阶段你只需要为命中的 token 付钱,不用额外为”存着”付钱,但既然写的是”限时”,就说明这不是永久承诺。
GLM-4.5 已经不在旗舰价目表里了。旧版这篇文章把 GLM-4.5 当作”唯一可核实的型号”重点讲,现在它只出现在微调和私有化部署的列表中,不再作为主推的按量计费型号。如果你的代码里还写着 glm-4.5,是时候看一眼要不要迁移了。同价位的替代选择大致是 GLM-4.5-Air(0.8 元起)或 GLM-4.7(2 元起)。
GLM-4.7 的”输出长度”档很值得注意。同样是输入不到 32K,输出控制在 200 token 以内的话输出价 8 元,一旦超过就跳到 14 元,接近翻倍。如果你的场景是分类、抽取、打标签这类天然短输出的活儿,把 max_tokens 卡住是能实打实省钱的;反过来,如果你做的是长文生成,就别指望吃到这一档。
免费档怎么用:GLM-4.7-Flash 长期免费
如果你的场景对模型能力要求不高(分类、摘要、简单问答这类),完全可以先绕开计费这件事:GLM-4.7-Flash 在官方价目表里输入、输出、缓存三项全部标注”免费”,200K 上下文,不是限时活动。想先跑通链路、验证需求,优先用它。
比它高一档但仍然很便宜的是 GLM-4.7-FlashX:输入 0.5 元、输出 3 元、命中 0.1 元。免费档遇到并发或速率限制时,这是最自然的下一步。
需要提醒的是模型下线这件事:曾经免费的 GLM-4.5-Flash 已在 2026-01-30 下线,现在请求会自动路由到 GLM-4.7-Flash,代码里的模型名建议同步改掉,别依赖自动路由长期兜底。
至于新用户注册赠送多少 token,网上说法一直不统一(有说 2000 万、也有说 1200 万加 500 万的组合),这个数字本次仍然没有在官方页面上核实到,所以这里依然不写具体数值。稳妥的做法没变:把免费的 Flash 模型当成你的成本基线,赠送额度当成”多的算白赚”,别把预算建立在一个来源不明的活动数字上。
省钱法:批量走 Batch,编程场景看订阅制
如果你的任务可以离线跑(夜间批量打标签、批量摘要这类),官方 Batch API 有明确的五折优惠——官方原文是”Batch API:高效完成大规模数据处理任务,只需五折费用”,这条口径这次复核依然有效,量大的场景值得优先接入 Batch 而不是走实时接口。
注意 Batch 五折和上面说的缓存命中是两种不同机制:一个是”异步换折扣”,一个是”复用前缀换折扣”。真要压成本,先判断你的任务是不是能接受异步,能接受就走 Batch,这是最省事的五折。
如果你是编程工具场景(接 Claude Code、Cline 这类客户端做代码补全/生成),智谱还有一套独立的 GLM Coding Plan 订阅套餐(Lite / Pro / Max 等档位),按”每 5 小时 / 每周”的额度限制计费,不是按 token 单价算钱——这和前面讲的按量计费是两套完全不同的商业模式,别拿两者互相换算对比。第三方资讯里还提到过面向更高阶场景的套餐,但这些套餐的具体价格和额度换算本次仍未在官方原文里核实到,只能告诉你”存在这类订阅制选项”,具体数字请去 bigmodel.cn 的套餐页当次查看。
月成本怎么估算
公式和其他家一样,关键是先确认你这次请求落在哪一档:
单次成本 = 输入 token 数 / 1,000,000 × 该档输入单价(命中则用命中价)
+ 输出 token 数 / 1,000,000 × 该档输出单价
月成本 ≈ 单次成本 × 每月请求数
举个例子,用 GLM-4.7 估算一个每天 3,000 次调用的问答功能,平均每次输入 1,500 token、输出 500 token。输入 1,500 token 落在 [0,32) 档,输出 500 token 超过了 0.2K 的界限,所以命中的是输入 3 元 / 输出 14 元那一档:
- 单次输入成本:1,500 / 1,000,000 × 3 元 = 0.0045 元
- 单次输出成本:500 / 1,000,000 × 14 元 = 0.007 元
- 单次合计:约 0.0115 元
- 每天 3,000 次:约 34.5 元
- 一个月(30 天):约 1,035 元
这里正好能看出分档的杀伤力:如果把输出压到 200 token 以内,档位变成输入 2 元 / 输出 8 元,单次成本降到约 0.0046 元,月成本约 414 元——同一个模型、同样的请求量,只因为输出长度跨了个档,账单差出一倍多。做成本模型时,光记模型名和”大概多少钱”是不够的,得把你的输入输出长度分布真的代进去。
如果你的调用能大量落在免费的 GLM-4.7-Flash 上,这部分成本直接归零;有批量离线任务的话,走 Batch 再打五折。
常见坑 / 注意
- GLM 已经改成分段计价:不再是一口价,输入长度(GLM-4.7 和 4.5-Air 还看输出长度)决定这次请求走哪档单价,估算前先确认自己落在哪一档。
- 输出长度也会跳档:GLM-4.7 输出超过 200 token,输出价从 8 元跳到 14 元。短输出场景卡住
max_tokens能实打实省钱。 - 缓存折扣约两成,不是九成:GLM 命中价大约是标价的 20%-25%,别拿 DeepSeek 那种降到 1%-2% 的力度来套 GLM。
- 缓存存储写的是”限时免费”:现在不额外收存储费,但”限时”两个字意味着这不是永久承诺。
- GLM-4.5 已退出旗舰价目表:代码里还写着
glm-4.5的,评估一下迁到 GLM-4.5-Air 或 GLM-4.7。 glm-4.5-flash已下线:现在请求自动路由到glm-4.7-flash,模型名建议同步改掉。- 新用户赠送额度仍未核实:说法不一致且可能过期,长期稳定免费的是
GLM-4.7-Flash本身。 - Coding Plan 和按量计费是两套体系:编程订阅套餐按时间/次数限额,不是 token 单价,别互相换算对比。
- 定价页是前端渲染:抓取工具会拿到空壳,自己核实时记得用浏览器真正打开页面看,别以为抓不到就是官网没公布。
接下来看什么
留言讨论
评论发布后会被人工复核,违规内容将被删除。
如果发表没有反应,可以前往联系我们告诉我们。