GLM 编程套餐的用量怎么算:什么情况会被判为超额

2026-08-25

数据截至 2026-08,价格与限额以各官网为准。本文只讲计费与接入机制,不列具体价格数字。

GLM Coding Plan 的用量不是按「调了几次」算的,而是把输入 token、缓存命中 token、输出 token 分别乘以各自的抵扣系数再换算成积分;联网搜索这类 MCP 工具则按调用次数乘 Output 系数计入同一个池子。额度有两道闸:每 5 小时一道、每周一道,两道是并存的约束,任意一道耗尽都会被拦下来,得等下一个周期恢复。而实践里绝大多数「我明明买了套餐怎么还扣钱」根本不是超额,是请求压根没走套餐——Base URL 配错、用了不在官方指定清单里的工具、或者在官网体验中心里跑。这两类问题的排查路径完全不同,先分清是哪一种,再谈省额度。

先分清:你手上是哪一版套餐

智谱在 2026 年 7 月 30 日改版了 Coding Plan,新版改成以 token 消耗为基础的积分制。老版本没有被强行切换:官方公告写明所有老用户权益完全不受影响,价格、权益、额度及计算方式都照旧。

但三类老套餐的后续安排并不一样,别一锅端着记:

  • V1 版个人套餐:当前已生效套餐可正常使用至当前套餐周期结束;在 V1 到期前,可以按 V2 的价格订阅(含续订、升级)V2 套餐,入口在套餐概览页。
  • V2 版个人套餐:可按照原套餐继续使用、续订和升档。
  • 团队套餐:可按照原套餐继续使用、续订;当前套餐到期前,系统不会开放切换新版积分套餐,到期后才能订阅新版线上在售套餐。

也就是说,只有 V1 被官方明确写到了「当前周期结束」,V2 和团队套餐是可以按原套餐续下去的。这个差别决定了你要不要急着规划迁移。

区分方法官方也给了:个人控制台的「套餐概览」页面会显示「历史版本 V1」或「历史版本 V2」,团队套餐则在「我的套餐」页面显示「团队套餐」;两个位置都没有对应标识,就说明套餐已到期或者还没订阅过。

这一步不能跳过。因为老版 V2 个人套餐的用量口径是「多少次 prompt」,新版积分套餐的口径是「多少积分」,两套口径下你看到的用量统计含义完全不同。拿着新版的算法去解释老版的进度条,只会把自己绕晕。下面讲的抵扣公式,说的是新版积分制。

积分是怎么被扣掉的:三类 token 各有各的系数

官方给出的计算方式是明确的公式,不是模糊描述:

  • 模型消耗积分数 =(输入 Token × Input 抵扣系数 + 缓存命中 Token × Cached Input 抵扣系数 + 输出 Token × Output 抵扣系数)/ 10000
  • MCP 消耗积分数 = 调用次数 × Output 抵扣系数

有几个信息值得单独拎出来。

第一,缓存命中的 token 被单列成了一类,用的是 Cached Input 抵扣系数,和普通输入 token 不共用一个系数。这意味着缓存命中率直接改变你的积分消耗速度,官方在「可用额度参考」里也是按不同缓存命中率分档给的参考区间。想弄明白怎么让缓存尽量命中,可以看GLM 上下文缓存怎么才能命中

第二,输出 token 的系数明显高于输入侧的系数,这是官方系数表的排序事实(具体数值以官方用量说明为准,会随版本调整)。所以让模型少说废话、少做无谓的整文件重写,比精简 prompt 更能省额度。这一点和按量计费下的成本结构是同一个方向。

第三,MCP 工具和模型共享同一个额度池,但两类 MCP 的计费口径并不一样。官方 FAQ 里问得很直白:视觉理解、联网搜索、网页读取、开源仓库这几个 MCP 的调用额度是多少?答案是模型与 MCP 共享套餐调用额度。不过翻到用量说明里的抵扣系数表就会发现,这四项并不在同一类里:

  • 联网搜索、网页读取、开源仓库三项被归在「MCP 工具」这个产品类型下,Input 与 Cached Input 两列都是「—」,只有 Output 抵扣系数——对应的正是「调用次数 × Output 抵扣系数」那条公式,不看 token 长度。
  • 视觉理解 MCP 在表里的产品名称写作 GLM-4.6V(视觉理解 MCP),被归在「模型」这个产品类型下,Input、Cached Input、Output 三个系数齐全,走的是模型那条按 token 算的公式。

这个区分对写 Agent 的人很实际。搜索、抓网页、拉开源仓库这三类,费不费额度只取决于你调了多少次,返回内容长短不改变这一笔;视觉理解则不同,喂进去的图和它吐出来的描述都要按 token 计。所以一个动不动就联网搜十几次的 Agent,省额度的办法是压住调用次数;一个反复截图丢给模型看的流程,省额度的办法是减少图片张数、别让它长篇描述。

高峰时段和非高峰时段,抵扣不一样

同样的 token 数,落在什么时间调用,扣掉的积分不一样。官方的规则是:非高峰时段内,模型调用按低于基础积分的比例抵扣,具体比例见官方用量说明。高峰时段被定义为工作日下午的一个固定时间窗(当前公告写的是周一至周五 14:00~18:00,UTC+8,以官方文档当前版本为准)。7 月 30 日的改版公告里还补了一条:周末全天按非高峰时段抵扣额度。

老版 V2 个人套餐的口径略有不同,它是在高阶模型上加消耗系数——官方在 V2 那段的说明里只点了 GLM-5.3 和 GLM-5-Turbo 这两个高阶模型,调用时高峰期按更高系数消耗额度、非高峰期回到基础系数(倍率数值以官方公告为准),高峰期的定义同样是周一至周五的那个下午窗口。至于「GLM-4.7 全天按基础系数消耗额度」这一条,出现在官方文档的团队套餐说明里,不要当成 V2 个人套餐的规则来记。两版的表述不一样,但指向同一件事:把重活挪出工作日下午那个窗口,是这套计费下最不费力的一次优化。

如果你的工作流本来就是白天写需求、晚上让 Agent 批量跑重构,那你其实已经在吃这个红利了;反过来,如果团队习惯下午三点开始集中提需求,这条规则值得摆到会上说一次。

额度真的用完了会怎样

这是最容易被误解的一环。官方说得很清楚:当套餐额度耗尽后,需要等待下一个 5 小时周期恢复额度,系统不会继续消耗你的其他资源包或账户余额

也就是说,套餐额度耗尽的表现是「用不了了、要等」,而不是「悄悄开始扣钱」。5 小时额度采用动态刷新机制,额度在请求消耗 5 小时之后刷新重置;周额度则是自套餐下单时起算,以 7 天为一个周期刷新。注意周期起点是下单时间,不是自然周的周一,这个设定挺反直觉,很多人算错就是错在这里。

所以,如果你看到的是「用不了、提示等待」,那多半是真超额;如果你看到的是账户余额在往下掉,那基本可以断定不是超额问题——请直接跳到下一节。

「买了套餐还扣余额」:先查这三处配置

官方 FAQ 里有一条专门的问题:为什么购买了编码套餐还报错「1113 余额不足」、为什么还扣账号余额?官方给出的原因有三条,全是配置问题:

  1. 套餐仅限在官方支持的指定工具与产品环境中使用。在规定工具之外调用 API,不享用 Coding 套餐额度。官方的指定清单涵盖 Claude Code、Codex、OpenCode、TRAE、CodeBuddy、Cline、Cursor 等一批 Coding Agent 工具(完整清单以官方接入工具页为准,会增补)。
  2. Base URL 必须配对。FAQ 这一条是按工具给的:Claude Code 用 https://open.bigmodel.cn/api/anthropic,Cherry Studio 用带结尾斜杠的 https://open.bigmodel.cn/api/coding/paas/v4/,这两者之外的工具用 https://open.bigmodel.cn/api/coding/paas/v4。同一批地址在官方的接入工具页里还有一张按协议归类的表:Anthropic Message 协议对应 https://open.bigmodel.cn/api/anthropic,OpenAI Chat Completion 协议对应 https://open.bigmodel.cn/api/coding/paas/v4,OpenAI Response 协议对应 https://open.bigmodel.cn/api/v1。官方在那一页专门用警告框强调:错误配置端点将导致无法使用 GLM Coding Plan 套餐额度。
  3. 官网体验中心不支持使用编码套餐。在网页体验区里试出来的消耗,不走套餐。

注意第二条里那个容易被忽略的细节:普通 API 的地址是 https://open.bigmodel.cn/api/paas/v4,编程套餐的地址中间多了一段 coding。两个地址长得几乎一样,粘贴时错一个词,请求照样成功、模型照样回答,只是钱从另一个口袋出。这也是为什么很多人直到看账单才发现问题。

想确认到底扣的是哪一份,官方给了查法:去费用明细页面,看「抵扣资源包」这一列是不是编码套餐。这一步比任何猜测都可靠。关于账单怎么盯,可以配合看API 成本监控怎么做

顺带一提,编码套餐过期之后,Claude Code 里暂不支持使用其他资源包;在其他编码工具里,把 Base URL 换回 https://open.bigmodel.cn/api/paas/v4 就能用资源包调用。

会被判违规的那几种「用量」

除了额度上限,还有一类「超额」是被风控判定的,性质完全不同。官方使用须知列了三条红线:

  • 套餐仅限订阅人专享,禁止账号共享或多人共用,违规将限制套餐权益,严重时影响账号正常使用;
  • 仅限指定工具使用,用于非支持工具将被限制权益;
  • 违规处置上,违反订阅及自动续费协议可能触发风控,被限流、冻结,多次违规可能被封禁账号。

官方对永久封禁的表述值得原样理解:它属于平台最高等级处置,会在证据充分、风险特征明确,并确认账号存在倒卖、中转、套利等严重违规行为时执行,不会因单一指标触发,会综合多个风险信号并结合人工复核。同时官方明确表示不会公开披露完整判定逻辑或后台日志。

也就是说,别指望能拿到一份「哪些行为算违规」的详细阈值表——没有。但申诉通道是有的:如果命中风控策略,可以在控制台的套餐概览页看到风控提示并发起申诉。

对多数正常开发者来说,真正要留意的其实只有一件事:别把套餐 Key 当成普通 API Key 塞进自建应用、网站、机器人或者 SaaS 产品里。官方在 FAQ 里给了正路——这类集成场景请使用智谱提供的标准 API 服务,按对应协议计费。

并发不是硬阈值,是随等级浮动的

速率(并发数)限制与套餐等级相关,平台会根据资源动态调整,基本原则是 Max 高于 Pro、Pro 高于 Lite。官方没有给出固定的并发数字,只给了推荐的同时开发项目数:Lite 建议单项目、Pro 建议一到两个项目、Max 建议两个以上(以官方使用须知当前版本为准)。官方还提到,套餐用户在低峰期会享有动态提升的并发权益。

另有一条容易踩的:套餐支持 OpenClaw 这类通用 Agent 工具,但采用次级调度与尽力交付策略,Coding Agent 任务享有资源抢占优先权,高负载时通用 Agent 任务会自动触发动态排队、限流等公平使用策略。所以拿套餐跑非编程的通用 Agent 任务,卡顿和排队是设计内的行为,不是故障。遇到限流该怎么处理,参考通用篇API 限流 RPM 与 TPM 怎么看

订阅侧那几个不可逆的动作

最后三条属于「知道了能少踩坑」的:

  • 自动续费按周期扣款,扣费顺序是先赠金余额、再现金余额、最后才从绑定的第三方支付方式扣。要取消必须提前操作,官方要求在下一个扣费日前留出规定的提前量(以官方文档当前版本为准),取消后当前周期继续有效、到期不再续费。
  • 不支持退款,一经购买即视为确认,没用完也退不回来。
  • 升级不叠加时间:再次购买或升级时会把之前的套餐作废,未使用时间会作为现有套餐的剩余价值计算到这次购买中。所以想着「先买个小的、不够再叠一个」的思路在这里行不通。

收尾:先查是不是没走套餐,再谈省额度

排查顺序建议固定成这样:看账户余额有没有掉 → 掉了就去费用明细看抵扣资源包是不是编码套餐 → 不是就回头核 Base URL 和工具是否在指定清单里 → 都对,再去用量统计看 5 小时和每周两条进度。

确认是真消耗之后,能动的杠杆只有三个:提高缓存命中率、压住输出 token、把重任务挪到非高峰时段。至于 MCP,记住联网搜索、网页读取、开源仓库这三类是按调用次数计的,Agent 里那些「顺手搜一下」的动作攒起来一点都不便宜;视觉理解那一项在官方系数表里归在模型类型下,要按 token 算,别把两者混成一笔估。想横向理解不同厂商在这件事上的共性,可以看GLM API 计费机制

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。