硅基流动的免费额度怎么用才不浪费?三种"免费"的区别与任务分层法

2026-07-27

数据截至 2026-07,价格与限额以各官网为准。

硅基流动上的”免费”不是一件事,而是三件互不相干的事:一是定价页上单价直接标 ¥0 的免费档模型,二是同一个模型拆出来的「免费版 / Pro 版」双档,三是平台不定期发放的赠送额度(2025-11-30 之后改成代金券形式)。绝大多数”免费额度用着用着就没了”的抱怨,根子在于把这三者混成一团,拿本该白嫖的活去烧余额,又拿本该付费的活去挤免费档的并发。

先承认一个很常见的误解:不少人以为注册硅基流动就会拿到一笔固定金额的赠款,把它当成”这个平台送我多少钱”的起点,然后开始算这笔钱能跑多少 token。这个思路本身就偏了。第三方评测文章里流传的具体赠送金额,在官方《用户充值协议》里并没有对应条款,这篇不会替它背书——你打开账户看到多少就是多少,以登录官网实际页面为准。更重要的是,真正能让你长期低成本跑起来的,从来不是那笔一次性的赠款,而是那批单价 ¥0 的常驻免费模型。

三种”免费”,先分清楚

第一种:免费档模型。 硅基流动上确实存在单价为 ¥0 的模型,事实层面能确认的包括 Qwen/Qwen3-8BQwen/Qwen3.5-4BQwen/Qwen2.5-7B-Instruct(免费版)、THUDM/GLM-4-9B-0414THUDM/GLM-Z1-9B-0414tencent/Hunyuan-MT-7Bdeepseek-ai/DeepSeek-OCRdeepseek-ai/DeepSeek-R1-0528-Qwen3-8B(Free)。这一档是”常驻”的,不消耗你的余额,用多少都是 ¥0。它才是你日常最该榨干的资源。

第二种:同模型的免费版 / Pro 双档。 不少模型在平台上同时存在两个条目,一个免费版一个 Pro(付费加速)版。两者的差别不在模型权重,而在速率限制和并发上限:免费版限速、限并发,Pro 版限速更高,价格通常也更高。典型例子是 Qwen/Qwen2.5-7B-Instruct,免费版单价 ¥0,Pro 版是 ¥0.35 输入 / ¥0.35 输出(每百万 token)。也就是说,Pro 版你付的那点钱,买的主要是吞吐和稳定性,不是智商。

第三种:赠送额度 / 代金券。 官方协议里把钱明确分成两类:充值余额是你实际付的人民币,没有使用期限,通过微信支付在线支付完成后 360 日内,未消费的部分可以自行申请退款(每笔限一次);赠送余额是平台不定期推出的充值优惠、邀请奖励之类的额外赠予,不可提现、不可转让、不可开票,平台享有最终解释权。还有一条容易被忽略的变化:2025-11-30 之后,平台激励改为以「代金券」形式发放,可以在”余额充值 > 代金券”里查看,此前的”赠送余额”发放形式已经调整。

分清这三种之后,“不浪费”这件事就有了明确定义:别拿第三种去干第一种能干的活。

免费档模型能干什么、不能干什么

免费档清一色是中小参数量的开源模型,8B、4B、9B 这个量级。它们的真实能力边界,得诚实地说:

适合交给它们的活——文本清洗和格式化、结构化抽取(从一段话里挑出人名日期金额)、意图分类和路由判断、给长文本做粗粒度摘要、批量生成模板化文案、翻译(tencent/Hunyuan-MT-7B 本身就是翻译向的模型)、OCR 相关任务(deepseek-ai/DeepSeek-OCR 就是干这个的)。这类任务的共同点是:输入输出格式清晰、判断维度不深、错了也容易被下游校验兜住。

不适合交给它们的活——多步推理、需要长链条逻辑连贯的代码生成、跨几万 token 的上下文关联分析、需要精准事实性的问答。硬塞给 8B 模型,你省下的钱会以”结果不能用、来回重试、人工返工”的形式加倍还回去。这不是免费模型的错,是任务分配错了。

THUDM/GLM-Z1-9B-0414 这类小模型从命名看带推理倾向,实际效果建议自己拿真实任务试一把再定,但也别指望它顶替旗舰模型。

把任务分层,是省钱的主要手段

真正有效的做法不是”能不能只用免费的”,而是在一条链路里按环节分配模型。举个典型的文档处理流程:

  1. 预处理与切分:纯规则代码,不调模型。
  2. 每段的信息抽取 / 打标签:交给 Qwen/Qwen3-8B 这类免费档,成本 ¥0。
  3. 跨段聚合与最终结论:这一步质量敏感,交给付费模型。
  4. 输出格式整理:又回到免费档。

第 3 步该选什么,看你的预算和质量要求。几个可参考的当前单价(¥/M Tokens):deepseek-ai/DeepSeek-V4-Flash 是 ¥1 输入 / ¥2 输出,Qwen/Qwen3-32B 是 ¥1 / ¥4,zai/GLM-4.5-Air 是 ¥1 / ¥6,deepseek-ai/DeepSeek-V3.2 是 ¥2 / ¥2,deepseek-ai/DeepSeek-R1(Pro)是 ¥4 / ¥16。可以看到,从免费档往上跳一档,成本增幅其实很温和——真正贵的是直接跳到旗舰档(比如 deepseek-ai/DeepSeek-V4-Pro 是 ¥12 / ¥24,zai-org/GLM-5.2 是 ¥6 / ¥28)。模型上下线和调价都比较频繁,实际数值以 https://siliconflow.cn/pricingGET /v1/models 接口为准。

分层的代码实现没什么难度,因为硅基流动是 OpenAI 兼容接口,切模型就是换一个字符串:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.getenv("SILICONFLOW_API_KEY"),
    base_url="https://api.siliconflow.cn/v1",
)

FREE_MODEL = "Qwen/Qwen3-8B"          # ¥0 档,跑量
PAID_MODEL = "deepseek-ai/DeepSeek-V3.2"  # 质量敏感环节

def ask(prompt: str, heavy: bool = False) -> str:
    resp = client.chat.completions.create(
        model=PAID_MODEL if heavy else FREE_MODEL,
        messages=[{"role": "user", "content": prompt}],
    )
    return resp.choices[0].message.content

# 批量粗加工走免费档
tags = [ask(f"给下面这段话打三个标签,逗号分隔:\n{seg}") for seg in segments]
# 最终结论走付费档
summary = ask("综合这些标签给出结论:" + "; ".join(tags), heavy=True)

注意模型名要带命名空间前缀(Qwen/deepseek-ai/THUDM/tencent/ 这些),漏了前缀会直接报模型不存在。密钥在 https://cloud.siliconflow.cn/account/ak 新建,只放环境变量,别硬编码。接入的完整步骤可以看 SiliconFlow 硅基流动 API 怎么接入

三种最常见的浪费

浪费一:拿付费模型跑本该免费档干的粗活。 最典型的是把”判断这条消息属于哪一类”这种二三十个 token 的分类任务扔给旗舰模型,跑几万条下来账单相当难看。分类、抽取、格式化这三类是免费档的主场,几乎没有理由付费。

浪费二:没有观测,凭感觉估。 很多人直到余额告急才第一次去看用量明细。建议从第一天就在代码里记录每次调用的模型名和 token 用量(响应里的 usage 字段就有),按模型分组统计。往往一看就能发现,八成的钱花在某一个没必要用重模型的环节上。

浪费三:把免费档当无限量在用。 免费档虽然单价 ¥0,但它限速、限并发。你开 50 个线程猛冲,结果是大量请求排队或失败,重试再重试,实际吞吐还不如老老实实控制并发。如果某个环节确实需要高吞吐又不需要高智商,把它切到对应的 Pro 版(比如 Qwen/Qwen2.5-7B-Instruct 的 Pro 版 ¥0.35 / ¥0.35),花的钱很少,省下的时间很多——这时候花钱买的是并发,不是能力。

关于代金券和余额,几件该知道的事

代金券和充值余额的性质不一样,规划时要区别对待:充值余额没有使用期限,而且在线支付(微信支付)完成后 360 日内,未消费部分可以自行申请退款,每笔限一次;赠送额度不可提现、不可转让、不可开票。所以如果你的公司需要报销发票,那部分只能对应实际充值的金额,赠送部分开不出来,报销前先跟财务对齐。

至于代金券的有效期、适用范围这些细则,官方协议里没有逐条列出统一规则,以你账户”余额充值 > 代金券”页面上显示的说明为准。稳妥的做法是:拿到代金券之后先去看它的说明,别默认它和现金余额等价。

什么时候该老实付费

诚实说局限:如果你的场景是这几类,别在免费档上耗时间——需要长上下文做整体理解的、需要生成可直接运行的中大型代码的、对事实准确性要求高且没有下游校验的、要做面向用户的最终输出且体验直接影响口碑的。这些场景下,免费模型省下的钱远小于返工成本。

另外一个要说清楚的:硅基流动上架的以开源模型和国产大模型托管版为主(DeepSeek、Qwen、GLM、Kimi、MiniMax、Hunyuan 这些系列)。如果你本来是想通过它间接用上 OpenAI、Anthropic、Google 的官方模型,那方向就不对——这些厂商的模型不在这个平台的上架范围内,而且它们官方本身也不支持中国大陆直连,这属于准入问题,不是换个平台就能绕过去的。想横向比较国产模型的价格,可以看 国产大模型 API 价格对比;想了解聚合与中转平台之间的差异,可以看 API 聚合与中转平台怎么选

小结

第一,把三种”免费”分清楚:¥0 的免费档模型是常驻资源,免费版/Pro 双档差的是速率不是能力,代金券是一次性激励且不可提现开票。第二,省钱的主力是任务分层,让分类、抽取、格式化这类粗活跑在免费档上,把质量敏感的环节留给付费模型。第三,从第一天就记录每次调用的模型和 token 用量,凭感觉估成本一定会估错。第四,免费档限速限并发,需要高吞吐时花很少的钱切到 Pro 版比硬扛重试划算。第五,价格和模型清单变动频繁,动手前以官网定价页或 GET /v1/models 的实时数据为准,别照抄任何一篇文章里的数字——包括这一篇。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。