GLM 编程套餐和按量计费怎么选:两种付费方式的适用边界
数据截至 2026-08,价格与限额以各官网为准。本文只讲计费与接入机制,不列具体价格数字。
结论先说:GLM 编程套餐和标准 API 按量计费是两条独立的链路,不是同一个钱包的两种打开方式。套餐用积分计量、绑定在官方指定的编码工具与专用编程端点上、额度按周期刷新且耗尽即停;标准 API 用账户余额或资源包计量、端点不同、场景不限。判断该走哪一边只看一件事:你的调用是不是发生在官方支持的编码工具里。如果是日常在 Claude Code、Cline 这类 Coding Agent 里写代码,套餐这条路才算数;如果你要把模型接进自己的网站、机器人或者 SaaS 产品,官方文档写得很直白——这种情况请使用标准 API 服务并按对应协议计费,套餐额度在这里一分钱都抵不了。搞混的直接后果就是那个经典报错:买了编码套餐,却仍然提示「1113 余额不足」,或者莫名其妙扣了账户余额。
先分清:决定走哪条链路的其实是 Base URL
很多人以为「我买了套餐,用同一个 API Key 调用就自动走套餐」,这是最大的误解。官方文档在常见问题里把「买了编码套餐还报错 1113 余额不足 / 还扣账号余额」列为独立一条,给出的原因有三个:一是套餐仅限在官方支持的指定工具与产品环境中使用;二是必须配置特定的 Base URL 才能命中套餐;三是官网体验中心不支持使用编码套餐。
第二条是最容易踩空的。官方文档在接入工具页面给出了编程端点的对应关系:Anthropic Message 协议、OpenAI Chat Completion 协议、OpenAI Response 协议各有各的 Base URL,且都是编程套餐专用的那一组地址;而当套餐过期、你想改用资源包调用时,官方给的做法是把 Base URL 换成标准 API 的那一个地址。换句话说,同一个账号、同一个模型名,端点写哪一个,决定了这笔调用从哪个口袋出钱。
官方文档还专门提示了一句:错误配置端点将导致无法使用 GLM Coding Plan 套餐额度。它不会报「你端点写错了」,它会正常跑完,然后从你的余额里扣。这个设计有点反直觉,但也解释了为什么账单里会出现自己完全没预期的支出。跨厂商的通用排查思路可以参考大模型 API 成本监控怎么做,GLM 这边的特殊之处在于,你首先要确认的不是用量,而是端点。
套餐这一侧:计量单位不是 token,是积分
标准 API 按量计费的计量单位是 token,这是大家熟悉的模式,机制层面可以看GLM API 计费怎么算。但编程套餐换了一套账:它的计量单位是积分。
官方给出的抵扣公式是明确的两条:
- 模型消耗积分数 =(输入 Token × Input 抵扣系数 + 缓存命中 Token × Cached Input 抵扣系数 + 输出 Token × Output 抵扣系数)/ 一个固定常数
- MCP 消耗积分数 = 调用次数 × Output 抵扣系数
具体系数和常数在官方《套餐概览》的表格里,会随模型和产品调整,这里不抄。但公式的结构本身就够你做判断了,有三个推论值得记住。
第一,输入、缓存命中输入、输出这三类 token 各有各的系数,官方表格里输出的系数最高、缓存命中输入的系数最低。这意味着让模型少说废话比让它少读代码更省额度,也意味着缓存命中率直接决定你这个套餐能撑多久——官方在「可用额度参考」里就是按不同缓存命中率分列的可用 token 区间。缓存本身怎么影响计费,可以看API 上下文缓存的计费机制。
第二,MCP 工具是按调用次数计积分的,不按 token。套餐自带的联网搜索、网页读取、开源仓库这几个 MCP,以及视觉理解 MCP,官方明确说明「模型与 MCP 共享套餐调用额度」。所以一个习惯性满世界搜索的 Agent 工作流,会在你毫无感觉的情况下吃掉模型侧的额度。
第三,官方按时段区分了抵扣比例:非高峰时段的模型调用按低于基础积分的比例抵扣,高峰时段按基础积分抵扣。高峰时段被定义在工作日下午的一个固定区间内,具体区间与抵扣比例以官方文档当前版本为准。这条的实际含义是,同样的活儿,避开工作日下午干,套餐能多撑相当一截。
额度耗尽后的行为差异,是选型的真正分水岭
按量计费的逻辑是余额扣到零才停。套餐不是。
官方文档写得很清楚:当套餐额度耗尽后,需要等待下一个周期恢复额度,系统不会继续消耗您的其他资源包或账户余额。常见问题里也单独问了一遍「套餐额度耗尽后,系统是否会继续消耗我的资源包/账户余额」,答案是不会。
这句话有两面。好的一面是成本封顶——你不会因为某天 Agent 跑飞了而收到一张意外账单,这对个人开发者和小团队是实打实的安全感。不好的一面是它会硬停:额度用光的那一刻,你手上那个跑到一半的重构任务就得等,等到下一个周期额度刷新。
而额度刷新的机制也值得单独说。官方设了两级上限:一级是小时级的滚动周期上限,一级是按周的周期上限(两个周期的具体长度以官方文档当前版本为准)。关键在于两者的刷新方式不一样:
- 小时级额度采用动态刷新机制。官方把它描述为动态刷新,积分额度是在请求消耗满一个周期之后才刷新重置,不是到整点就归零,而是跟着你的消耗时刻往前滚。所以「我等到下个整点就好了」这个直觉是错的:按官方这条规则,决定你什么时候恢复的是请求发生的时刻,而不是墙上的钟。要知道自己还剩多少、什么时候回,官方给的办法是去控制台的用量统计页看,别自己掐表推算。
- 周额度是自套餐下单时起按周期刷新,也就是说你的「一周」从下单那一刻算起,和自然周的周一无关。
对应到选型上:如果你的工作负载是可以被打断、可以排队的(自己写代码,被卡住就去干别的),套餐的硬停不构成问题;如果你的负载是不能断的(线上服务、给客户跑的批处理、有交付时点的任务),套餐这条路从机制上就不适合你,得走按量计费,或者至少留一条按量的后路。
有些场景套餐从规则上就用不了
这是很多人买之前没看清的部分。官方对套餐的使用范围有硬约束,不是「不建议」,是「不允许」:
- 仅限指定工具。套餐只能在官方支持的指定工具与产品环境中使用,用于范围之外的工具或场景,官方明确表示将限制权益。官方文档列出的支持范围分两类:一类是 Coding Agent 工具(Claude Code、Cline、Roo、TRAE、CodeBuddy、OpenCode、Cursor、Kilo 等),另一类是通用 Agent 工具。
- 通用 Agent 工具是次级公民。官方对 OpenClaw、Cherry Studio 这类通用 Agent 明确说明采用「次级调度与尽力交付策略」,Coding Agent 任务享有资源抢占优先权,高负载下通用 Agent 的任务会自动触发动态排队、限流等公平使用策略。你可以用,但别把它当成主力生产链路。
- 禁止账号共享。套餐为订阅人专享,官方把多人共用同一套餐视为不当使用,可能限制订阅权益。官方还专门写了永久封禁说明,指向的是倒卖、中转、套利这类行为。
- 自建应用必须走标准 API。官方原话是:如需在自建应用、网站、机器人、SaaS 产品等场景中通过 API 集成模型能力,请使用智谱提供的标准 API 服务,并根据对应协议计费。
所以「用套餐给我的产品供给模型能力」这条路是堵死的,不是技术上堵,是规则上堵。想清楚这一点,选型问题会简单很多。
怎么确认自己扣的到底是哪一边
官方给了两个可操作的入口,都比猜要靠谱:
- 费用明细里的抵扣资源包字段。官方在常见问题里回答「怎么查看是否扣的是编码套餐」时,指的是到费用中心的费用明细页,看「抵扣资源包」这个列项,能看出这笔消耗是不是用编码套餐抵扣的。
- 用量统计页。套餐额度的消耗进展和剩余额度在控制台的用量统计页看,两级周期各自的进度都在这里。
排查顺序建议这样走:先看用量统计,如果套餐额度纹丝不动、余额却在掉,那基本就是端点或工具环境不对;再回去核对 Base URL 是不是编程端点那一组,工具是不是在官方支持清单里;最后确认这个 Key 的来源——官方特别提示过,团队版套餐的 Key 与平台其他 API Key 不通用,要用团队额度就必须用团队套餐的 Key。Key 的管理规范可以参考GLM API 接入指南里的说明。
换挡、续费和退出,规则比想象中硬
选型不只是选一次,还包括后面怎么调整,这几条官方规则最好提前知道:
- 升级是即时生效的。在订阅管理里选择升级、支付差额,新套餐立即生效。
- 但升级不叠加时间。官方明确说:再次购买或升级编码套餐时,会把之前的套餐作废,之前套餐未使用的时间会作为现有套餐的剩余价值,计入你的再次购买中。所以不要指望「先买小的,不够再买大的,时间累加」。
- 不支持退款。官方原话是订阅服务一经购买即视为确认,不支持退款,即使没用完也无法退回。
- 默认自动续费,取消要提前。订阅在每个计费周期结束时自动续费,官方要求在下一个扣费日之前提前若干天取消(具体天数以官方文档为准),取消后当前周期继续有效,到期后不再续费。
- 扣费有优先级顺序。官方给的顺序是:先用平台账号内的赠金余额,赠金不足用现金余额,都不足再从绑定的第三方支付方式扣款。这条对财务对账很关键——你以为是微信扣的,实际可能是账户里的赠金先被吃掉了。
- 套餐过期后想接着用资源包,官方说明在 Claude Code 中暂不支持使用其他资源包,在其他编码工具中需要把 Base URL 改回标准 API 的地址才能用资源包调用。
一个可以直接照做的判断流程
把上面的规则压缩成几个问题,按顺序问自己:
第一问,调用发生在哪里?在自建应用、线上服务、给外部用户提供的产品里 —— 直接走标准 API 按量计费,不用往下看了。在官方支持清单里的编码工具里 —— 继续。
第二问,负载能不能被打断?不能断、有交付时点、跑批处理 —— 至少要准备按量计费作为兜底,因为套餐会硬停。能断 —— 套餐合适。
第三问,用量形态是什么?长上下文反复对话、缓存命中率高、能避开高峰时段的 —— 套餐这套积分抵扣规则对你有利。零散低频调用 —— 按量计费更灵活,不受套餐那两级周期额度上限的约束。但要说清楚,「不受套餐周期上限约束」不等于随便怎么打都行:官方对开放平台的 API 调用另有速率限制机制,按模型维度设置并发上限,并发数指的是同一时刻正在处理中的请求数量,限制量级还和账户的用户权益等级相关,超了会返回对应的限流错误码。也就是说,走按量计费换掉的是「额度用完要等下一个周期」这个约束,换不掉「同一时刻能压多少请求在途」这个约束。这一层怎么排、怎么退避,是另一套需要单独准备的预案。
第四问,是不是团队用?是的话注意团队套餐的 Key 是独立的一套,用错 Key 走不到团队额度上。
最后提醒最容易栽的一个坑:配置对了不代表一直对。换机器、换工具、重装插件之后,别默认那份 Base URL 配置还在原地,先回去核对一遍它是不是编程端点那一组。至于哪些操作会让这份配置失效,官方文档里没有找到相关说明,所以这件事只能靠自己核,不能指望有人提醒你——官方给的唯一硬提示就是那句:错误配置端点将导致无法使用 GLM Coding Plan 套餐额度。它不是一条报错,是一个结果。
把这条落成动作也很简单:换环境之后先发一个小请求,然后按前面那节的顺序走一遍——先看用量统计页,套餐额度有没有动;再看费用明细里的「抵扣资源包」列项,这笔到底是不是编码套餐抵扣的。两处对上了再开始正式干活,比事后翻账单省心得多。