模型平台专题

智谱 GLM 开放平台

评估一个模型平台的时候,真正决定你用不用得下去的,往往不是它的单价—— 而是缓存能不能命中、限流按什么维度算、思考 token 算不算钱、账单为什么突然翻倍、 以及你手上那个工具链能不能把它接进去。本专题共 32 篇,就按这个顺序展开。 内容依据智谱开放平台官方文档整理,核对日 2026-08-25。 本专题只讲计费与接入机制,不列具体价格数字—— 价格变动频繁,写进正文只会过期误导,请以 官方文档与定价页 为准。

从这里开始 · 2026-07-07

智谱 GLM API 怎么接入?密钥申请、SDK 调用与免费额度

讲清智谱 GLM API 怎么接入:开放平台注册拿密钥、OpenAI 兼容 base_url 与官方 zhipuai SDK 两种最小调用方式、哪几个 Flash 模型能长期免费用,以及新手常踩的坑。

编程套餐怎么用

套餐制和按量计费是两套完全不同的成本模型,用量怎么算、什么情况判超额、团队席位怎么分、自带的几个 MCP 服务能干什么——先把规则看清楚再决定买哪种。

2026-08-25

在 Claude Code 里用 GLM 编程套餐:完整配置步骤

把 GLM Coding Plan 接进 Claude Code,卡住的地方几乎都不在安装,而在 Key 拿错、Base URL 填错、settings.json 里模型编码没改。本文按官方文档梳理从取 Key 到 /status 验收的完整顺序,并给出被扣账号余额时的排查方向。

2026-08-25

GLM 编程套餐常见问题逐条拆解:额度、扣费与报错

把智谱官方 GLM Coding Plan 常见问题页里的坑逐条拆开:为什么买了编程套餐还提示余额不足、额度按什么周期刷新、哪些工具和场景不算在套餐里、MCP 工具是否单独计费、升级续订有哪些不可逆的动作,以及怎么确认一笔消耗到底扣的是谁。

2026-08-25

GLM 编程套餐的用量怎么算:什么情况会被判为超额

拆解 GLM Coding Plan 的积分抵扣公式、5 小时与每周双额度、高峰与非高峰的抵扣差异,并说清哪些情况其实不是超额而是压根没走套餐——配错 Base URL、用了非指定工具、以及会触发风控的违规用量。

2026-08-25

GLM 编程套餐和按量计费怎么选:两种付费方式的适用边界

GLM 编程套餐(GLM Coding Plan)和标准 API 按量计费不是同一条计费链路,端点、额度单位、耗尽后的行为、适用场景全都不同。这篇按官方文档把两者的边界讲清楚,并给出判断自己该走哪一边的方法。

2026-08-25

GLM 编程套餐团队版怎么用:席位分配与用量归集

GLM 编程套餐团队版按席位订阅,每位成员拿的是独立的团队套餐 Key,用量以积分方式按席位单独归集。这篇按管理员的真实操作顺序讲清席位规则、积分怎么扣、超额按量付费怎么开、订阅怎么改,以及哪些行为会触发平台风控。

2026-08-25

GLM 编程套餐自带的四个 MCP 服务怎么用

GLM Coding Plan 套餐附带联网搜索、网页读取、开源仓库、视觉理解四个专属 MCP 服务。这篇按官方文档梳理它们各自暴露的工具名、远程与本地两种接入形态、Claude Code 里哪些已内置哪些还要手动装、以及四个 MCP 在积分抵扣上的口径差异和连不上时的排查顺序。

接入形态与兼容层

GLM 同时提供了 OpenAI 兼容和 Anthropic Claude 兼容两条路,加上官方 SDK 与 LangChain 集成。兼容不等于等价,边界在哪这几篇讲清楚。

2026-08-25

GLM 的 OpenAI 兼容层边界:哪些参数它不认

智谱 GLM 提供 OpenAI 兼容接口,但兼容不等于等价。本文按官方文档梳理 OpenAI 兼容层的三类边界:查不到的参数、只能靠 extra_body 透传的原生字段、同名但约定不同的参数,以及响应侧多出来的取值,帮你把迁移风险提前挖出来。

2026-08-25

GLM 兼容 Anthropic Claude API:怎么接、哪里不一样

智谱 GLM 提供了 Anthropic Claude API 兼容层,改 base_url、API Key 和模型编码就能把现有 Anthropic SDK 代码切过来。这篇按官方文档梳理接入步骤、鉴权头差异、端点怎么选、思考强度在两种场景下的不同规则,以及易忽略的限制。

2026-08-25

GLM 接入 LangChain 怎么配:从 base_url 到 Agent

智谱 GLM 接入 LangChain 走的是 OpenAI 兼容路径,用 ChatOpenAI 换掉 base_url 就能跑。本文按官方文档梳理装包、配 Key、提示模板、对话记忆、Agent 与流式输出的完整配置顺序,并说清哪些地方官方没写、需要自己兜底。

2026-08-24

GLM API Key 怎么申请?在哪找、怎么用、额度在哪看

GLM API Key 申请全过程:按智谱开放平台官方文档走一遍从注册账号到第一次调用,讲清 glm apikey 在控制台哪个入口新建、放进代码的正确姿势、编程套餐 Key 和通用 API Key 为什么不通用,以及常见的几种「key 用不了」分别对应哪个错误码、额度和账单该去哪个页面查。

计费机制与成本

缓存怎么才能命中、什么写法会把命中打断、按输入长度分段计价怎么理解、思考 token 算不算钱、账单突然变高从哪查起。只讲机制与算法,具体单价以官方定价页为准。

2026-08-25

什么写法会打断 GLM 的缓存命中

GLM 上下文缓存是隐式触发的,没有开关,所以命不中的时候也没有报错。这篇按排查顺序拆开五类会打断 GLM 缓存命中的写法,从响应里的 cached_tokens 字段读起,到系统提示词里的时间戳、临时拼接的模板、被改写的思考内容,最后说清哪些情况官方文档根本没有说明。

2026-08-25

GLM 按输入长度分段计价是什么意思:怎么把单次输入量算准

官方文档里关于 GLM 分段计价能核到的只有一条:部分推理模型会配置阶梯定价,用户权益的价格优惠对这类模型不生效,分几档、边界在哪都没有公开说明。这篇讲你自己能做的部分:用官方分词器接口把单次请求的输入 token 量算准,以及哪些内容会被算进输入。

2026-08-25

GLM 的思考 token 算不算钱:怎么把它控制住

GLM 开启深度思考后,思维链内容会不会计入账单?这篇按官方文档梳理 thinking、reasoning_effort、clear_thinking 三个开关的实际作用,以及 usage 字段该怎么读、账单变高该从哪几个方向排查,只讲计费机制不列价格数字。

2026-08-25

GLM 发票申请与企业采购授权怎么走

智谱 GLM 开放平台按实际消耗金额开票,不按充值金额开票,赠送类金额一律开不出来;模型商用授权是面向开源模型权重的另一条独立流程,只对企业用户开放。这篇按财务和法务两条线,把开票口径、欠费影响、主体变更顺序、商用授权申请条件讲清楚。

2026-08-25

GLM 上下文缓存怎么才能命中:触发条件与写法

GLM 的上下文缓存是隐式缓存,不用开关也没有手动声明的接口,命中与否完全取决于你把 messages 摆成什么样。这篇讲清楚触发条件、判断命中的那个响应字段、三种容易命中的写法,以及缓存对计费口径的影响边界。

2026-07-27

GLM 有哪些免费模型?能用到什么程度

逐个说清智谱 GLM 当前哪几款模型是长期免费的(GLM-4.7-Flash、GLM-4-Flash-250414,以及已下线自动路由的 GLM-4.5-Flash),免费档和"新用户赠送额度"的区别,免费能撑住哪些真实场景、什么时候必须换付费型号。

2026-08-25

GLM 账单突然变高怎么排查:五个常见原因

GLM 账单比上个月高出一截,先别猜。这篇按官方文档能查到的机制,把智谱开放平台账单异常拆成缓存失效、思考 token、搜索结果计入输入、按次计费模型、非调用型扣费五类原因,给出可执行的排查顺序与止血动作。

2026-07-07

GLM API 价格怎么算?智谱各模型 token 单价、分段定价与省钱用法

GLM 已经不是一口价,旗舰款全部改成按输入长度分段定价。本文给出智谱 GLM 各模型的官方价格表与缓存命中价、GLM-4.7-Flash 长期免费怎么用、Batch 折扣与 Coding Plan 订阅制的区别,以及月成本怎么估。

能力边界

思考模式怎么开关、结构化输出怎么保证格式、function calling 怎么写、流式下的工具调用怎么拼装。每条能力断言都对着官方文档核过。

2026-08-25

GLM 结构化输出怎么保证格式不跑偏

GLM 的结构化输出靠 response_format 开启 JSON 模式,但只开这个字段并不足以保证格式稳定。这篇按官方文档梳理字段取值、结构声明位置、客户端校验、finish_reason 截断识别与思考模式下的解析边界,给出一条能落到生产的防跑偏链路。

2026-08-25

GLM 流式输出下的工具调用怎么拼装:分片合并与踩坑清单

GLM 开启流式后工具调用参数分片下发,官方文档明说这些分片不做缓冲也不做 JSON 校验。本文讲清 stream 与 tool_stream 两个开关的关系、delta 三个字段的归属、按 index 归并分片的写法,以及边收边解析、丢失 tool_call_id 两个高频坑。

2026-08-25

GLM 流式输出中断了怎么办:先看 finish_reason 再谈重试

GLM 流式输出中断时别急着抓错误码:官方文档说明推理过程中异常终止不返回业务错误码,异常原因写在 finish_reason 里。本文按排查顺序讲清连接层断开、服务端异常终止与安全审核拦截怎么区分,各取值该不该重试。

2026-08-25

GLM 思考模式怎么开怎么关:参数与适用场景

GLM 的思考模式不是「加个开关就完事」——新一代模型默认就在思考,有的型号还关不掉。这篇按官方文档梳理 thinking.type、reasoning_effort、reasoning_content 三个关键点,以及交错式、保留式、轮级思考各自的适用场景与写错会踩的坑。

2026-08-25

GLM function calling 怎么写:从工具定义到结果回传

按官方文档梳理 GLM function calling 的完整写法:tools 里每一层字段的含义、tool_choice 只支持 auto 这个容易踩的限制、tool_calls 响应怎么解析、函数结果用什么结构塞回 messages,以及第二轮请求为什么还得带上 tools。

批量、限流与排查

Batch 接口什么时候值得用、任务失败怎么排、限流字段怎么读、鉴权失败逐条查、错误码对照表。

2026-08-25

GLM 错误码含义与处置对照

智谱 GLM 的 API 返回码分 HTTP 状态码和业务错误码两层,同一个 429 背后可能是欠费、限速、平台过载或套餐额度耗尽。这篇按官方错误码表逐段拆开每个 GLM 错误码的真实含义,给出对应的处置动作,并说明流式调用下错误码为什么会"消失"。

2026-08-25

GLM 鉴权失败逐条排查:从 API Key 到 JWT 签名

GLM 鉴权失败时该看哪一层:智谱开放平台把 401 拆成了四个业务错误码,分别对应请求头缺失、Key 无效、Token 过期和二次认证。这篇按真实排查顺序走一遍,顺带说清哪些看起来像鉴权问题其实不是。

2026-08-25

GLM 限流字段怎么读:并发、频次与提额路径

智谱 GLM 的速率限制核心是并发请求数,不是每分钟请求数。这篇讲清楚限额在控制台哪几个页面看、通用 API 与 Coding Plan 两套口径的区别、撞限流时几个 429 错误码分别代表什么,以及提额申请该怎么走、什么情况下根本不支持申请。

2026-07-27

GLM API 常见报错排查:密钥、模型名与配额

按"从外往里剥"的顺序排查智谱 GLM API 报错:base_url 填错、ZAI_API_KEY 没读到、模型名一字之差(glm-4-flash-250414 与 glm-4-flashx-250414)、上下文与最大输出超限、配额与限速、订阅套餐额度和按量计费混淆,以及为什么不要照抄网上的错误码解释。

2026-07-27

GLM API 撞限流怎么办:并发和配额是两回事

智谱 GLM API 返回 429 时,先别急着去充值。这篇拆开并发上限、速率限制、按量计费余额、订阅套餐额度四件事的区别,给出用信号量压在途请求、指数退避重试、免费 Flash 分流、Batch 五折错峰的具体做法,并说明为什么智谱这边不适合"照着数字表算并发"。

2026-08-25

GLM Batch 批量接口什么时候值得用

GLM Batch 批量接口按低于标准价计费、并发额度独立,但只适合能等结果的离线任务。这篇按官方文档拆开 jsonl 构造、文件上传、任务状态机与结果下载,说清什么任务值得改成 Batch,什么任务改了反而更麻烦。

2026-08-25

GLM Batch 任务失败怎么排查:从状态字段到错误文件

GLM Batch 批量任务失败,先要分清是整个任务没通过校验,还是任务里的个别请求出错。本文按官方文档的状态枚举、Batch 对象字段和错误文件机制,把提交前、执行中、拿结果三个阶段的排查路径逐段拆开,并说明过期批次的计费口径。

其他

本专题下尚未归入上面任何一组的文章。

想把模型平台的差异挡在业务代码之外?

站内有成体系的 AI 编程与 Agent 工程教程,从接入到成本治理都覆盖。

看 AI 编程学习路线