GLM API 价格怎么算?智谱各模型 token 单价、分段定价与省钱用法

2026-07-07 · 更新于 2026-08-09
站内工具 大模型 API 价格对比表 → 豆包 / GLM / Kimi / 千问 / DeepSeek 等 9 家厂商单价并排看,可按币种筛选、按价格排序,每行链到官方定价页。

数据截至 2026-08-09,价格与限额以各官网为准。本次更新用浏览器渲染了官方定价页,拿到了此前抓不到的完整价目表。

智谱 GLM 的计费结构在这一版有两个必须重讲的变化:一是它已经不是”一口价”了,旗舰款全部改成按输入长度(部分还看输出长度)分段计价;二是缓存命中价成了价目表里的独立一列,力度大概是标价的四分之一。至于省钱,路子没变——GLM-4.7-Flash 依然长期免费,先拿它把链路跑通,量上去了再挑档位。

这篇的上一版写得非常保守:因为官网定价页是前端 JS 渲染的,抓取工具只能拿到一个空壳,所以当时全文只敢确认 GLM-4.5 一个型号的价格,其余全部标成”未核实”。这次重核换了方法——直接用浏览器把页面渲染出来再读,完整价目表拿到了。所以这一版不再有那一长串留白,下面的数字都是官方定价页上的逐字原文。

先说结构变化:GLM 现在是分段计价了

如果你对 GLM 的印象还停留在”输入 0.8 元、输出 2 元,简单明了”,那个印象需要更新了。现在官方旗舰价目表里,除了最新的 GLM-5.2 和免费档,其余型号都按单次请求的输入长度分档,GLM-4.7 和 GLM-4.5-Air 甚至还要再看输出长度。

这个变化对估算成本的影响不小:同一个模型,你发一个短 prompt 和发一个塞了整份文档的长 prompt,落进的档位不一样,单价也不一样。所以”GLM 多少钱一百万 token”这个问题,现在已经没法用一个数字回答了,得先问”你这次请求输入多长”。

另外一个容易搞反的地方:官方旗舰价目表现在的表头单位是每百万 tokens,跟主流平台对齐了。旧版本文章提醒过”官方是按千 tokens 报价、横评时别把单位搞反”,这条提醒现在对旗舰表已经不适用了——但页面下方”模型推理”板块里那批更早的 GLM-4 系列型号仍在,口径不一定跟旗舰表一致,如果你要用那批老型号,单位还是自己确认一眼更稳妥。

各模型单价表:这次是官方逐字数字

以下全部来自 bigmodel.cn/pricing 旗舰模型价目表,单位元/百万 tokens,档位里的数字是千 token(比如”[0,32)“指输入不到 32K token):

模型档位输入输出缓存命中
GLM-5.2(新品)1M 全量8 元28 元2 元
GLM-5.1输入 [0,32)6 元24 元1.3 元
GLM-5.1输入 [32+)8 元28 元2 元
GLM-5-Turbo输入 [0,32)5 元22 元1.2 元
GLM-5-Turbo输入 [32+)7 元26 元1.8 元
GLM-5输入 [0,32)4 元18 元1 元
GLM-5输入 [32+)6 元22 元1.5 元
GLM-4.7输入 [0,32) 且输出 [0,0.2)2 元8 元0.4 元
GLM-4.7输入 [0,32) 且输出 [0.2+)3 元14 元0.6 元
GLM-4.7输入 [32,200)4 元16 元0.8 元
GLM-4.5-Air输入 [0,32) 且输出 [0,0.2)0.8 元2 元0.16 元
GLM-4.5-Air输入 [0,32) 且输出 [0.2+)0.8 元6 元0.16 元
GLM-4.5-Air输入 [32,128)1.2 元8 元0.24 元
GLM-4.7-FlashX200K0.5 元3 元0.1 元
GLM-4.7-Flash200K免费免费免费

几个读表要点:

缓存命中价大约是标价的两成。把每一行的命中价除以输入价,比例几乎都落在 20%-25% 之间(GLM-5.2 是 2÷8=25%,GLM-4.7 最低档是 0.4÷2=20%)。这个折扣力度比 DeepSeek 那种降到 1%-2% 的要温和得多,横评时别把两家的”缓存折扣”混为一谈——不是一个数量级。另外缓存存储费目前标注为”限时免费”,也就是说现阶段你只需要为命中的 token 付钱,不用额外为”存着”付钱,但既然写的是”限时”,就说明这不是永久承诺。

GLM-4.5 已经不在旗舰价目表里了。旧版这篇文章把 GLM-4.5 当作”唯一可核实的型号”重点讲,现在它只出现在微调和私有化部署的列表中,不再作为主推的按量计费型号。如果你的代码里还写着 glm-4.5,是时候看一眼要不要迁移了。同价位的替代选择大致是 GLM-4.5-Air(0.8 元起)或 GLM-4.7(2 元起)。

GLM-4.7 的”输出长度”档很值得注意。同样是输入不到 32K,输出控制在 200 token 以内的话输出价 8 元,一旦超过就跳到 14 元,接近翻倍。如果你的场景是分类、抽取、打标签这类天然短输出的活儿,把 max_tokens 卡住是能实打实省钱的;反过来,如果你做的是长文生成,就别指望吃到这一档。

免费档怎么用:GLM-4.7-Flash 长期免费

如果你的场景对模型能力要求不高(分类、摘要、简单问答这类),完全可以先绕开计费这件事:GLM-4.7-Flash 在官方价目表里输入、输出、缓存三项全部标注”免费”,200K 上下文,不是限时活动。想先跑通链路、验证需求,优先用它。

比它高一档但仍然很便宜的是 GLM-4.7-FlashX:输入 0.5 元、输出 3 元、命中 0.1 元。免费档遇到并发或速率限制时,这是最自然的下一步。

需要提醒的是模型下线这件事:曾经免费的 GLM-4.5-Flash 已在 2026-01-30 下线,现在请求会自动路由到 GLM-4.7-Flash,代码里的模型名建议同步改掉,别依赖自动路由长期兜底。

至于新用户注册赠送多少 token,网上说法一直不统一(有说 2000 万、也有说 1200 万加 500 万的组合),这个数字本次仍然没有在官方页面上核实到,所以这里依然不写具体数值。稳妥的做法没变:把免费的 Flash 模型当成你的成本基线,赠送额度当成”多的算白赚”,别把预算建立在一个来源不明的活动数字上。

省钱法:批量走 Batch,编程场景看订阅制

如果你的任务可以离线跑(夜间批量打标签、批量摘要这类),官方 Batch API 有明确的五折优惠——官方原文是”Batch API:高效完成大规模数据处理任务,只需五折费用”,这条口径这次复核依然有效,量大的场景值得优先接入 Batch 而不是走实时接口。

注意 Batch 五折和上面说的缓存命中是两种不同机制:一个是”异步换折扣”,一个是”复用前缀换折扣”。真要压成本,先判断你的任务是不是能接受异步,能接受就走 Batch,这是最省事的五折。

如果你是编程工具场景(接 Claude Code、Cline 这类客户端做代码补全/生成),智谱还有一套独立的 GLM Coding Plan 订阅套餐(Lite / Pro / Max 等档位),按”每 5 小时 / 每周”的额度限制计费,不是按 token 单价算钱——这和前面讲的按量计费是两套完全不同的商业模式,别拿两者互相换算对比。第三方资讯里还提到过面向更高阶场景的套餐,但这些套餐的具体价格和额度换算本次仍未在官方原文里核实到,只能告诉你”存在这类订阅制选项”,具体数字请去 bigmodel.cn 的套餐页当次查看。

月成本怎么估算

公式和其他家一样,关键是先确认你这次请求落在哪一档:

单次成本 = 输入 token 数 / 1,000,000 × 该档输入单价(命中则用命中价)
         + 输出 token 数 / 1,000,000 × 该档输出单价
月成本 ≈ 单次成本 × 每月请求数

举个例子,用 GLM-4.7 估算一个每天 3,000 次调用的问答功能,平均每次输入 1,500 token、输出 500 token。输入 1,500 token 落在 [0,32) 档,输出 500 token 超过了 0.2K 的界限,所以命中的是输入 3 元 / 输出 14 元那一档:

  • 单次输入成本:1,500 / 1,000,000 × 3 元 = 0.0045 元
  • 单次输出成本:500 / 1,000,000 × 14 元 = 0.007 元
  • 单次合计:约 0.0115 元
  • 每天 3,000 次:约 34.5 元
  • 一个月(30 天):约 1,035 元

这里正好能看出分档的杀伤力:如果把输出压到 200 token 以内,档位变成输入 2 元 / 输出 8 元,单次成本降到约 0.0046 元,月成本约 414 元——同一个模型、同样的请求量,只因为输出长度跨了个档,账单差出一倍多。做成本模型时,光记模型名和”大概多少钱”是不够的,得把你的输入输出长度分布真的代进去。

如果你的调用能大量落在免费的 GLM-4.7-Flash 上,这部分成本直接归零;有批量离线任务的话,走 Batch 再打五折。

常见坑 / 注意

  • GLM 已经改成分段计价:不再是一口价,输入长度(GLM-4.7 和 4.5-Air 还看输出长度)决定这次请求走哪档单价,估算前先确认自己落在哪一档。
  • 输出长度也会跳档:GLM-4.7 输出超过 200 token,输出价从 8 元跳到 14 元。短输出场景卡住 max_tokens 能实打实省钱。
  • 缓存折扣约两成,不是九成:GLM 命中价大约是标价的 20%-25%,别拿 DeepSeek 那种降到 1%-2% 的力度来套 GLM。
  • 缓存存储写的是”限时免费”:现在不额外收存储费,但”限时”两个字意味着这不是永久承诺。
  • GLM-4.5 已退出旗舰价目表:代码里还写着 glm-4.5 的,评估一下迁到 GLM-4.5-Air 或 GLM-4.7。
  • glm-4.5-flash 已下线:现在请求自动路由到 glm-4.7-flash,模型名建议同步改掉。
  • 新用户赠送额度仍未核实:说法不一致且可能过期,长期稳定免费的是 GLM-4.7-Flash 本身。
  • Coding Plan 和按量计费是两套体系:编程订阅套餐按时间/次数限额,不是 token 单价,别互相换算对比。
  • 定价页是前端渲染:抓取工具会拿到空壳,自己核实时记得用浏览器真正打开页面看,别以为抓不到就是官网没公布。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。

留言讨论

评论发布后会被人工复核,违规内容将被删除。

    还没有人评论,来说说你的看法

    如果发表没有反应,可以前往联系我们告诉我们。

    这个页面有问题?

    提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。