国产大模型 API 免费档横评:能白嫖到什么程度

2026-07-27

数据截至 2026-07,价格与限额以各官网为准。

“能白嫖到什么程度”这个问题没法用一句话回答,因为免费档的天花板不是一个数字,而是五条同时生效的边界:上下文窗口、单次最大输出、并发与速率限制、要不要绑支付方式、以及这个免费档会不会突然下线。任何一条卡住,你的项目就得掏钱。横评国产大模型 API 的免费档,真正该比的是这五条,而不是比谁的宣传页上”赠送 token”数字更大。

先承认一个很常见的误解:不少人把”新用户注册送 N 千万 token”当成免费档的实力证明,然后把它写进技术方案的成本一栏。这两件事完全不是一回事。赠送额度是一次性预付,用完就结束;而真正意义上的免费档,是厂商在官方文档里单独开一页、明确标注”该模型免费”的那种模型,只要它还在架上,你就可以一直调。前者是促销,后者才是能进架构图的东西。

横评该比哪六件事

我自己比国产大模型免费档的时候,固定填这张表,六列缺一不可:

  1. 是不是官方文档标注的免费模型:注意是文档里独立成页写着免费,而不是活动页、公众号推文或者第三方汇总文章里说的免费。
  2. 上下文窗口:决定你一次能塞多少资料进去。做长文档问答、代码库理解的,这一列直接决定可行性。
  3. 单次最大输出:很多人只看上下文不看输出上限,结果生成长报告时被截断,还以为是模型偷懒。
  4. 速率限制(RPM/TPM):免费档基本都有并发天花板,这是”个人玩具”和”能上线”之间最常见的分水岭。
  5. 要不要绑卡:免费但要求先绑支付方式的,跟不绑卡就能调的,风险性质完全不同。
  6. 下线与迁移策略:厂商停掉某个免费模型时,是自动路由到继任者,还是直接报错?这决定了你会不会在某个周一早上收到一堆 500。

前三列基本能在官方文档查到,第四列常常查不到具体数字,第五列只能看历史记录。下面用一个能查到官方原文的样本走一遍。

样本:智谱 GLM 的免费档能拿到什么

我手上核实到官方文档原文的样本是智谱 GLM,所以这一节的数字可以直接引用;其他厂商的数字我不替你猜,理由放在后面单说。

按智谱官方文档(docs.bigmodel.cn)中标为”免费模型”的几页:

  • glm-4.7-flash:免费,上下文窗口 200K,单次最大输出 128K。这是目前免费档里规格最舒服的一个。
  • glm-4-flash-250414:免费,上下文窗口 128K,官方原文称其为”智谱AI首个免费大模型API”;最大输出这一项官方页面上我没核到明确数字,以官网当前说明为准。
  • glm-4.5-flash:曾经免费,但已于 2026-01-30 下线,请求会自动路由到 glm-4.7-flash

第三条其实是这张表里信息量最大的一行。它说明这家的免费档不是”某天悄悄消失”,而是有继任者接管、老模型 ID 的请求自动落到新模型上。对已经上线的项目来说,这种下线方式的杀伤力比直接报 404 小得多——但也别把它当成永久保证,模型换代后行为可能有差异,输出格式敏感的场景该回归测试还是得测。

再看多模态:第三方公开资料提到 GLM-4.6V-Flash 也是免费的视觉模型,不过这条我没在官方文档原文里逐字核到,只能标注为”第三方口径”,真要用在项目里,先自己去官网确认一遍。

没核到的那几列也要如实说:免费档具体的 RPM/TPM 限制,官方文档页面上没有展示数字,我这边也没核实到,所以这一列在我的表里是空的。至于”新用户注册赠送多少 token”,网上流传的说法互相打架(有说两千万的,也有拆成两个模型分别若干的),都没有官方页面逐字支撑,正确做法是注册后直接看账户页面实时显示的额度,别信任何二手汇总。

白嫖的实际天花板在哪

把边界翻译成人话,免费档大致能撑住这些事:

  • 学习与练手:跑通链路、试 prompt、做课程作业,免费档完全够,从头到尾不用花钱。
  • 原型和 demo:给同事或客户演示一个想法,单人使用、并发极低,免费档一般不会卡。
  • 个人小工具:定时抓点内容做摘要、本地脚本批量改写文案这类低频任务,免费档很适合。
  • 前置处理环节:把免费的轻量模型放在链路前端做意图分类、脏数据过滤、要不要走大模型的判断,只在必要时才把请求交给付费模型。这是免费档最被低估的用法,省下来的钱比”全部用免费模型”更实在,因为质量还守得住。

反过来,下面这些场景不建议指望免费档:

  • 面向不特定用户的线上服务,并发不可控,限速会直接变成用户看到的报错。
  • 输出质量直接决定收入的环节,比如对外交付的正式文案、生产代码的主力生成。免费档模型定位就是轻量高速,不是拿来扛主力活的。
  • 需要稳定 SLA 的企业内部系统。免费的东西厂商没有义务对你的可用性负责,这话不好听但是事实。

从免费档跨到付费档,成本落差有多大

很多人担心”免费用着用着突然要付一大笔”,其实国产按量计费的单价并没有想象中吓人。仍以智谱为例,官方文档里 GLM-4.5 的原文表述是输入 0.8 元/百万 tokens、输出 2 元/百万 tokens;GLM-4.6 在多篇第三方资料里的口径是约 5 元/百万 tokens,但没有官方原文逐字支撑,也没说清是否输入输出同价,所以只能当参考。更新的 GLM-4.7、GLM-5 系列具体单价,我这边没有核到官方逐字数字,写代码前请自己打开官网定价页确认,我不编。

这里有两个坑值得单独点名:

第一个坑是单位。 智谱官方口径是”按每千 tokens 计费”,而横评时大家习惯统一换算成”每百万 tokens”。1 元/千 tokens 等于 1000 元/百万 tokens,换算方向别搞反了——我见过有人把千和百万的换算搞颠倒,结论直接差三个数量级,然后得出”这家贵得离谱”的错误判断。

第二个坑是定价页抓不到。 智谱的定价页是前端 JS 渲染的单页应用,很多爬虫和自动化工具抓下来是空的。这意味着你在网上看到的”某某模型多少钱一百万 token”,大概率是别人手抄的,抄错一位数没人会告诉你。要用在正式方案里,就自己打开浏览器看一眼当前页面。

另外,如果你的任务不要求实时返回,官方的 Batch API 有五折优惠,大批量离线处理时这一档比调免费模型硬扛限速要划算得多,值得先算一笔账再决定。

至于订阅制的编程套餐,那是跟按量计费完全不同的计价结构(按时间窗口给额度,而不是按 token 累加),横评时不要把它和 token 单价混在一列里比,否则怎么比都是错的。具体档位和价格以官方套餐页面为准。

接入成本本身也是横评的一部分

免费档好不好用,还有一个容易被忽略的维度:接进来要改多少代码。目前国产平台普遍提供 OpenAI 兼容接口,这意味着换厂商的迁移成本可能低到只改两行。以智谱为例,官方文档给出的 Chat 通用兼容地址是 https://open.bigmodel.cn/api/paas/v4/,并建议把密钥放进环境变量 ZAI_API_KEY

# pip install --upgrade "openai>=1.0"
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("ZAI_API_KEY"),
    base_url="https://open.bigmodel.cn/api/paas/v4/",
)

completion = client.chat.completions.create(
    model="glm-4.7-flash",  # 免费档,先跑通链路
    messages=[{"role": "user", "content": "你好,请自我介绍一下。"}],
)
print(completion.choices[0].message.content)

也可以用官方原生 SDK(pip install zhipuai,调用方式是 ZhipuAI(api_key=...) 再走 chat.completions.create)。两条路核心能力一致,已经有 OpenAI 兼容基础设施的项目用前者最省事。

横评的时候,我会把”是否提供 OpenAI 兼容层”也算作一列。提供的,意味着你可以把多家免费档挂在同一套代码后面轮换测试,甚至做兜底降级;不提供的,每换一家都要重写一层适配,隐性成本比 token 单价高得多。

为什么这篇只横评国产

有人会问,为什么不把海外几家的免费档也拉进来一起比。原因很直接:截至 2026-07,OpenAI、Google Gemini、Anthropic 这类服务在官方层面并不支持中国大陆直连,账号注册、控制台、API 端点都在境外,把它们的免费额度写进国内项目的成本表,本身就是个不成立的前提。市面上确实存在第三方中转和聚合平台声称能转发,但这类服务的合规性、计费透明度和数据处理方式都要用户自己承担风险,我不背书也不推荐具体渠道。

对国内团队来说,国产平台的免费档有一个海外服务给不了的优势:链路简单、发票和主体清楚、出问题能找到人。这一条在做技术选型时的权重,往往比模型评测榜上的几个百分点更高。

自己动手核一遍的操作顺序

如果你要给自己的项目做一次横评,建议按这个顺序来,能省掉大部分返工:

  1. 先去各家官方文档站找”免费模型”专页,只把有独立文档页的模型收进候选表。活动页宣传的一律先不算。
  2. 对每个候选模型记下上下文窗口和最大输出,这两项通常文档里写得最明确。
  3. 打开浏览器(不要用抓取工具)看当前定价页,把付费档的单价抄下来,注意千/百万的单位换算。
  4. 注册账号,在账户页面看真实的赠送额度和限速提示,以自己看到的为准。
  5. 用同一段 prompt 在几家免费模型上跑同样的任务,实测输出质量和首字延迟——这一步没法查文档,只能自己跑。
  6. 故意打高并发,看看多久触发限流、报什么错、要不要退避重试。这一步决定了它能不能上线。

第 5、6 步最花时间,但也最有价值。文档里的数字告诉你边界在哪,实测才告诉你在边界之内好不好用。

小结

国产大模型的免费档能白嫖到的程度,比多数人以为的要高,但边界和多数人以为的不一样——限制你的通常不是”额度用完了”,而是并发上限和输出长度。横评时把六列表填完,比看任何一篇排行榜都管用。手上唯一能引用官方原文的样本里,glm-4.7-flash 提供 200K 上下文、128K 最大输出且免费,glm-4-flash-250414 同样免费,老的 glm-4.5-flash 下线后自动路由到继任模型,这套迁移方式对已上线项目比较友好。所有具体价格、赠送额度和速率限制,请以你打开官网当时看到的页面为准,我这篇不替官方做承诺。最后一句提醒:免费档最好的用法不是”全都用它”,而是让它守住链路前端的粗活,把钱花在真正决定结果质量的那一步上。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。