Gemini API 收费吗?免费层额度、付费单价与省钱用法

2026-07-07

数据截至 2026-07,价格与限额以各官网为准。

Gemini API 有免费层,但”免费”是有条件的:Flash 系列目前确实免费可用,Pro 档模型的免费状态存在信息冲突需要自行确认;一旦你的项目开通计费,就不再是”免费额度用完才收费”,而是从第一个 token 起全额计价。搞懂这条分界线,比记住任何一张价格表都重要。

这篇把计费规则按”免费层怎么判定→付费单价多少→月成本怎么估→怎么省”的顺序讲一遍,数字都来自官方定价页核实过的部分,没核实的地方会明确标出来,不瞎编。

免费层和付费层的分界线

先说最容易搞混的一点:Gemini API 的”免费”不是那种”每月送你多少额度,用完自动转付费”的逻辑。它是账户形态层面的免费——你的项目只要没开通计费(billing),调用免费层可用的模型就不收费,一旦开通计费,该项目下所有调用立刻按标准价从第一个 token 起算,不会先消耗掉之前”免费剩余”再切换。这跟 BigQuery 等其它 Google Cloud 服务”免费额度用完再收费”的常见逻辑不是一回事,容易让第一次接触 Google Cloud 系产品的人误判。

哪些模型有免费层:官方定价页目前对 gemini-2.5-flashgemini-2.5-flash-litegemini-3.5-flashgemini-3.1-flash-lite 都标注着免费可用。Pro 档(如 gemini-3.1-pro-preview)的免费层状态是本卡核实中发现的唯一一处信息冲突:官网定价页对 gemini-2.5-pro 仍写着免费,但也有信源提到 2026-04-01 起 Pro 系列已经从免费层下架,而 gemini-3.1-pro-preview 的模型页确实明确写了 Free Tier “Not available”。这个矛盾本文不替你下结论,用 Pro 档做免费开发前务必自己去当前官网页面确认一遍。

另外有个地区叠加规则:欧盟(EEA)、瑞士、英国因为监管要求,免费层完全不可用,当地开发者必须开通计费账户,哪怕实际用量本来在”免费范围”内也一样,形态上就是必须付费。

各模型付费单价表

下面是当前在售主力模型的单价(每百万 token,美元,standard 档,不含 Batch/长上下文加价的特殊情况),只列已核实过的数字:

模型上下文窗口输入价输出价备注
Gemini 3.5 Flash100万 token$1.50$9.00免费层可用
Gemini 3.1 Flash-Lite未核实$0.25(文本/图/视频,音频 $0.50)$1.50免费层可用
Gemini 3.1 Pro Preview100万 token$2.00(≤20万 tok)/ $4.00(>20万 tok)$12.00(≤20万 tok)/ $18.00(>20万 tok)免费层”Not available”
Gemini 2.5 Pro100万 token$1.25(≤20万 tok)/ $2.50(>20万 tok)$10.00(≤20万 tok)/ $15.00(>20万 tok)免费层状态存在冲突,见上节
Gemini 2.5 Flash100万 token$0.30(文本/图/视频,音频 $1.00)$2.50免费层可用
Gemini 2.5 Flash-Lite未核实$0.10(文本/图/视频,音频 $0.30)$0.40免费层可用

几点读表提示。第一,超过 20 万 token 的长上下文会加价,这一点在 Pro 档模型上体现得很明显(2.5 Pro 从 $1.25/$10 直接跳到 $2.50/$15),如果你的场景经常塞长文档进去,这笔加价要提前算进成本模型。第二,音频输入的价格通常比文本/图片/视频更贵一档(2.5 Flash 文本 $0.30 对音频 $1.00),做语音相关功能时候别按文本价估。第三,2.5 系列和 3.x 系列并存——2.5 系列更成熟稳定,3.x 系列(3.5 Flash、3.1 系列)是较新上线的,性能和定价都可能随时间调整,做长期成本规划时留意官网是否有更新。

顺带提一句非文本主力模型的价格供参考:Veo 3.1(视频生成)约 $0.40–$0.60/秒(720p–4K),Imagen 4(图片生成)约 $0.02–$0.06/张,Gemini Embedding 2 文本 $0.20/百万 token,这几个数字未逐一核实细节,用前以官网为准。

月成本怎么估算

估算方法跟其它 token 计费的 API 大同小异:

单次成本 = 输入 token 数 / 1,000,000 × 输入单价
         + 输出 token 数 / 1,000,000 × 输出单价
月成本 ≈ 单次成本 × 每月请求数

举个例子感受量级。假设用 Gemini 2.5 Flash($0.30 输入 / $2.50 输出)做一个内容摘要功能,平均每次请求输入 3,000 token(原文加提示词)、输出 300 token,每天 2,000 次请求:

  • 单次输入成本:3,000 / 1,000,000 × $0.30 = $0.0009
  • 单次输出成本:300 / 1,000,000 × $2.50 = $0.00075
  • 单次合计:约 $0.00165
  • 每天 2,000 次:约 $3.3
  • 一个月(30 天):约 $99

同样这套负载换成 Gemini 2.5 Pro($1.25 输入 / $10 输出,按 20 万 token 以内价档):

  • 单次:3,000 / 1M × $1.25 + 300 / 1M × $10 = $0.00375 + $0.003 = $0.00675
  • 一个月:约 $405

差了 4 倍左右。这跟很多按 token 计费的 API 一个道理:先按真实样本量一量平均输入输出 token,再乘请求量,别凭感觉估。token 数可以从响应对象里的用量字段实测,具体字段名以官方 SDK 文档为准。

如果你的项目还没开通计费、又用的是免费层可用的模型(比如 2.5 Flash),这部分调用在账单上是 $0,但前提是别踩前面说的那个”一开计费全额起算”的坑——测试阶段最好专门用一个没绑计费账户的项目。

省钱用法

单价改不了,但下面几招能实打实压账单,且都是已核实过确实存在的机制。

一、Context Caching:重复内容打一折读取

如果你的请求里有一大段固定不变的内容——长系统提示、参考文档、few-shot 示例——每次都全价发送很浪费。Gemini 的 context caching 机制下,缓存读取价格约为标准输入价的 10%,跟很多同类 API 的缓存折扣力度接近。代价是要按 token/小时另付一笔存储费(2.5 系列大致在 $1.00–$4.50/百万 token/小时这个区间,具体以官网为准),所以适合那种会被高频复用、复用窗口内摊销划算的固定内容,一次性内容缓存反而不划算。

二、Batch API:不急的活儿打五折

不需要实时返回的任务——批量打标、离线摘要、大批翻译——可以用 Batch API 异步提交,所有付费模型统一享受约 50% 折扣(输入输出同比例打折),代价是最长可能要等 24 小时才拿到结果。跟 Claude 那边的 Batch 逻辑思路一致:只要业务能接受异步,这是最直接的省钱方式之一。

三、选对 Flash 档,别默认上 Pro

前面月成本例子已经演示过,同样负载 Pro 比 Flash 贵好几倍。实操上可以按任务难度分级路由:简单分类、短摘要、意图识别这类交给 Flash-Lite 或 Flash 就够;只有真正需要复杂推理、长链条判断的任务才考虑 Pro 档。免费层目前主要覆盖的也是 Flash 系列,从成本和额度两个维度看,Flash 都是更稳的默认选择,Pro 留给明确需要更强能力的场景。

四、留意长上下文加价档

如果你的输入经常在 20 万 token 上下浮动,提前测一下是不是频繁踩过加价线。能通过摘要、裁剪历史对话等方式把输入控制在加价线以下,账单会有明显差异,这个思路跟其它长上下文 API 的省钱逻辑是相通的。

这几招可以叠加:Batch 的五折能跟 context caching 一起算,配合选对模型档位,组合起来的降幅比单用一招明显。

常见坑 / 注意

  • 免费层不是”额度用完转付费”:是账户形态问题,开通计费后从第一个 token 起全额计价,专用测试项目分开管理更安全。
  • Pro 档免费层状态有冲突:官网标注和第三方信息不一致,别按本文任何说法直接规划生产用量。
  • 长上下文有加价档:超过 20 万 token 后单价上调,长文档场景提前把这笔账算进去。
  • 音频输入通常比文本贵:按模态分别核价格,别拿文本单价套音频场景。
  • 欧盟/瑞士/英国免费层直接不可用:当地开发者必须开通付费账户形态。
  • 成本要实测别拍脑袋:用响应里的用量字段量真实 token,再乘请求量估月账。
  • 2.5 与 3.x 系列并存:3.x 是较新系列,定价和能力可能随时间调整,长期规划留意官网更新。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。