文心 API 免费额度实测:能撑住什么规模
数据截至 2026-07,价格与限额以各官网为准。
想给文心 API 的”免费额度”下一个定量结论,目前给不出来——千帆的公开计费页并没有列出一个通用的、面向所有新用户的赠送 token 数额,账号里到底有没有、有多少,只能以你登录控制台后账户页面实时显示的为准。但这并不意味着这条路走不通:千帆在架模型里有输入 0.1 元每百万 tokens 这一档,用这类模型跑验证,十块钱能撑住的调用量远超大多数人的直觉。与其纠结”有没有免费”,不如直接算”十块钱能撑多大规模”,这个数字反而是确定的。
先承认一个几乎人人都会踩的误解:很多人看到”文心一言免费用”就默认文心 API 也免费。这是两个产品、两套计费体系——文心一言的网页端和 App 是面向普通用户的对话产品,千帆平台上按 token 计费的 API 调用是给开发者的云服务,前者的免费政策不会自动延伸到后者。同理,ERNIE 4.5 系列已经开源这件事,也不等于你调千帆的 API 不花钱:权重开源是让你可以自己下载部署,通过千帆 API 调用仍然按计费页的价格走。把这两件事分开,后面的账才算得清。
一、先把”免费”这个词拆成三件事
在千帆这个语境下,“免费”至少对应三种完全不同的东西,混在一起谈必然算错账:
第一种是新用户赠送额度。 这是大家最想问的那种”白送的 token”。实话实说:本文写作时能抓到的官方计费页面并没有直接展示这类条款,第三方渠道的说法也不一致,所以本文不给任何具体数字。正确做法是登录百度智能云控制台,进入千帆的账户/资源页面,看当时页面上实际展示的可用资源包和有效期——赠送政策是运营动作,随时可能调整,任何教程里写死的数字都不该被当成依据。
第二种是开源权重免费。 据公开报道,百度在 2025-06-30 开源了文心大模型 4.5 系列,一次性放出多款不同规模的模型,采用 Apache 2.0 协议、支持商用;权重可以在飞桨星河社区、HuggingFace 的 baidu 组织页下载。这部分建议直接去这两个平台核对模型清单和协议原文,别信二手转述。开源的价值是你可以把小模型跑在自己的机器上,推理成本变成电费和显卡折旧,但这条路的前提是你有卡、有人维护,跟”API 免费”是两码事。
第三种是近乎免费的低价档位。 这才是绝大多数个人开发者应该盯的东西。千帆在架模型里,ernie-4.5-0.3b(ERNIE 4.5 开源 0.3B 稠密版)的官方在线价是输入 0.0001 元每千 tokens、输出 0.0004 元每千 tokens,换算成大家更习惯的单位就是 0.1 元 / 0.4 元每百万 tokens。这不是 0 元,但便宜到了”充值十块钱基本忘了它存在”的程度。
二、能查到的最低价档位长什么样
把千帆计费页上适合做验证和轻量生产的几档列一下(官方原始单位是元/千 tokens,这里统一换算成元/百万 tokens,方便横向比对):
| 模型 ID | 上下文 | 输入(元/百万 tokens) | 输出(元/百万 tokens) |
|---|---|---|---|
ernie-4.5-0.3b | 128K | 0.1 | 0.4 |
ernie-lite-pro-128k | 128K | 0.2 | 0.4 |
ernie-speed-pro-128k | 128K | 0.3 | 0.6 |
ernie-4.5-turbo-128k | 128K | 0.8(在线) | 3.2(在线) |
ernie-5.1 | 128K | 4(≤32K)/ 6(32K–128K) | 18(≤32K)/ 22(32K–128K) |
单看这张表能得到一个很实用的结论:从 lite/speed 档跳到旗舰 ernie-5.1,输入价差大约二三十倍,输出价差四十倍以上。 所以”用不用得起”这个问题,答案几乎完全由你选了哪一档决定,跟有没有赠送额度关系不大。
ernie-4.5-turbo-128k 还有一档批量(批处理)价:输入 0.00032、输出 0.00128 元每千 tokens,也就是 0.32 / 1.28 元每百万 tokens,约为在线价的四成。另外这个系列的缓存命中部分按 0.0002 元每千 tokens 计(0.2 元每百万 tokens)。这两个数字后面算账要用到。
需要提醒的是,千帆页面上时不时会出现”某月活动”之类的批量推理限时折扣,那是活动价不是长期价,做预算时别把它当基准;百度历史上也发过整体刊例价调整公告,说明价格会变,你看到这篇文章时务必回计费页再确认一次当前数字。模型的完整价目和分档逻辑,可以参考站内这篇:文心 ERNIE API 多少钱?千帆各模型 token 单价与成本。
三、按三种典型用法算一遍:几块钱撑多大规模
下面这些数字都是用上表单价直接乘出来的,你可以按自己的实际 token 用量替换参数重算。
用法一:普通问答型对话。 假设单次输入 1000 tokens、输出 500 tokens(一个不长不短的问答回合):
- 用
ernie-lite-pro-128k:输入 0.0002 元 + 输出 0.0002 元 = 约 0.0004 元/次,1 元大约能跑 2500 次。 - 用
ernie-4.5-0.3b:约 0.0003 元/次,1 元大约 3300 次。 - 用
ernie-4.5-turbo-128k在线价:0.0008 + 0.0016 = 0.0024 元/次,1 元大约 416 次。 - 用
ernie-5.1(≤32K 档):0.004 + 0.009 = 0.013 元/次,1 元大约 77 次。
也就是说,如果只是想验证”这个产品思路走不走得通”,充 10 元用 lite 档,你有两万多次调用的余量,绝对够你把 demo 反复调到满意。
用法二:内部小工具,有稳定日活。 假设每天 500 次调用,单次输入 1500 tokens、输出 600 tokens:
ernie-4.5-turbo-128k在线价:单次约 0.00312 元,每天约 1.56 元,一个月不到 50 元。- 换成
ernie-lite-pro-128k:单次约 0.00054 元,每天约 0.27 元,一个月 8 元出头。
一个部门内部用的问答助手、周报汇总工具,成本大概就是这个量级。这类场景真正的开销往往不是 token,而是维护它的人。
用法三:批量文档处理。 假设单篇输入 8000 tokens、输出 800 tokens:
ernie-4.5-turbo-128k在线价:单篇约 0.00896 元,1000 篇不到 9 元。ernie-5.1(≤32K 档):单篇约 0.0464 元,1000 篇约 46 元。
结论很直白:文档批处理这类任务,成本瓶颈几乎总是输入侧。 输入 token 是输出的十倍,所以选一个输入价便宜的档位,比省输出更管用。
四、想继续往下压,有三个开关
开关一:能异步就走批量。 ernie-4.5-turbo-128k 的批量价约为在线价的四成,前面那个 1000 篇文档的例子,从 9 元降到 3 元多。代价是延迟——批处理是异步排队,不适合面向用户的实时交互,但对夜间跑的数据清洗、标签生成、批量摘要这类任务几乎没有损失。判断标准很简单:这个结果用户是不是要立刻看到?不是的话就该走批量。
开关二:把稳定前缀交给缓存。 ERNIE 4.5 Turbo 系列命中缓存的部分按 0.2 元每百万 tokens 计,相对在线输入价 0.8 元有明显折扣。如果你的每次请求都带着一段几千 token 的固定系统提示词、固定的少样本示例或固定的知识片段,这部分让它命中缓存,省下来的就是实打实的。做法上要注意把”稳定的内容放前面、变化的内容放后面”,缓存本质是前缀匹配,前面动一个字后面就全废了。这类通用技巧可以看Token 成本优化:比换便宜模型更有效的几招。
开关三:小任务别用大模型。 这是最省钱也最容易被忽略的一条。分类、抽字段、判断意图、生成短标签这类任务,ernie-lite-pro-128k 和 ernie-4.5-0.3b 通常够用,没必要一律上旗舰。实际工程里更常见的是分层路由:先用便宜模型跑一遍,只有它判断”这个我搞不定”的时候才升级到 ernie-5.1。这样整体均价能压到接近便宜档,而质量下限由旗舰兜底。
五、真要确认额度,只有一条可靠路径
聊了半天省钱,回到最初的问题:你账号里到底有没有免费额度、还剩多少?可靠做法只有一条——看控制台,不看教程。
前提是完成百度账号的实名认证(企业或个人),部分权益和额度是跟实名类型挂钩的。认证完成后进控制台,在千帆的资源/账单相关页面查看当前可用的资源包、剩余量和到期时间。密钥这块,官方现在推荐的是新版 API Key,格式以 bce-v3/ALTAK- 开头,按官方说法是永久有效,可以直接作为 Authorization: Bearer 头使用;OpenAI 兼容层的 base URL 是 https://qianfan.baidubce.com/v2。完整的申请和第一次调用流程见百度文心 ERNIE API 怎么接入,调不通的常见报错见文心 API 报错排查。
顺带说一个容易走错门的点:千帆还有一套面向编程工具的 Coding Plan,端点是 https://qianfan.baidubce.com/v2/coding,那是订阅制套餐,跟本文讲的按 token 计费的通用推理服务是两回事,别把两边的额度和价格混在一起理解。
计费方式上,千帆以按量后付费为主,部分模型也支持按量包预付费、按每分钟 token 数付费等模式。如果你的用量已经稳定,预付费包有时比后付费划算;但在用量还没跑稳之前,先按量付费、拿真实账单说话,比一上来买包更稳妥。
六、诚实说局限
有几件事本文没法替你确定,也不打算硬给结论:
- 新用户赠送额度的具体数额和有效期,官方计费页未直接展示,本文不给数字。任何声称”新注册送 X 万 token”的说法,请回控制台自己核对。
ernie-5.0系列和部分 Thinking 版本的价格,官方给的是区间而非逐项拆分,本文不做更细的估算。- 价格本身会变。 百度历史上做过整体刊例价调整,限时活动折扣也时有时无。这篇里的所有单价,请以你阅读当天的官方计费页为准。
- 不同模型的实际表现差异不在本文测算范围内。 便宜三十倍不代表能力只差三十倍,也不代表在你的任务上够用——省钱的前提永远是效果先达标,建议用你自己的真实样例跑一轮对比再定档。
- 如果你在把千帆和其他平台横向比较:国内几家的免费额度政策各不相同,可以参考通义千问免费额度实测和国产大模型 API 免费档横评;如果比较对象是海外平台,那几家官方并未面向中国大陆开放,具体以各自官网的地区政策页为准,本文不提供也不背书任何第三方中转渠道。
小结
千帆平台没有一个可以公开引用的”新用户免费送多少 token”的定量条款,账号里有没有额度,只能登录控制台看实时页面。但这个问题其实没那么重要——真正决定你能不能用得起的,是选了哪一档模型:lite/speed 档下 1 元能跑两三千次普通问答,旗舰档 1 元只够几十次,差着二三十倍。做验证阶段直接上便宜档,把省下来的注意力放在提示词和产品逻辑上更值。批量、缓存、分层路由这三个开关能在此基础上再压一截,尤其批量价约为在线价的四成,对夜间跑的离线任务几乎是白捡的。最后,把”文心一言免费”和”ERNIE 4.5 开源”这两件事跟”千帆 API 计费”彻底分开,是所有算账的前提。