OpenRouter 上怎么挑性价比模型?一套可复现的比价方法

2026-07-28

数据截至 2026-07,价格与限额以各官网为准。

在 OpenRouter 上挑模型,比”哪个模型最强”更有用的问题是”我这个任务的单位产出成本是多少”。同一个价目表,做长文摘要和做代码补全算出来的账完全不同——因为前者烧输入 token,后者烧输出 token,而这两项在几乎所有模型上都不是一个价。

常见的误解是把模型页上那一行”每百万 token 多少美元”当成性价比排序的唯一依据,挑一个数字最低的接上去用。真按这个逻辑选,很容易出现两种结果:一是便宜模型答不对,重试两三次反而更贵;二是账单跟预估对不上,因为忽略了输出价、上下文长度和平台侧的充值手续费。这篇把这几层拆开说,顺便给一套自己就能跑的比价流程。

先把”性价比”翻译成一个能算的公式

OpenRouter 的定位是海外的模型聚合平台:一个 API key、一套 OpenAI 兼容接口,就能调到上百个模型,涵盖 OpenAI、Anthropic、Google 的闭源系列以及 Qwen、DeepSeek、Llama、Gemma 等一批开源模型,平台还会自动处理故障转移和路由(来源:OpenRouter 官方 quickstart 文档)。选择面一大,“挑便宜的”这个动作反而没了边界。

可执行的做法是把性价比落到三个数上:

  1. 单次任务的输入 token 数——你的 prompt 加上下文、检索到的资料、历史对话,大致有多少。
  2. 单次任务的输出 token 数——期望模型回多长。做分类可能只有几十个 token,写文档可能几千。
  3. 达标率——同一批样本跑下来,有多少次结果是不用人工返工的。

然后算:单次成本 = 输入token/1M × 输入价 + 输出token/1M × 输出价,再除以达标率,得到”每一次可用产出的成本”。这个数才是能横向比的。一个单价便宜三成但达标率只有六成的模型,实际比贵的那个还费钱,而且多花的人工核对时间没算进去。

输入价和输出价要分开看,别只盯一个数

官方模型页对每个模型分别标输入价和输出价,两者差距通常不小。以 2026-07 从 OpenRouter 官方模型页直接核到的三个代表型号为例:

模型输入(每百万 token)输出(每百万 token)上下文窗口
OpenAI GPT-5.5$5$301M(922K 输入 + 128K 输出)
Anthropic Claude Opus 4.7$5$251M
Google Gemini 2.5 Pro$1.25$101M

这三行是官方模型页当次核实所得,其余型号的价格请以 openrouter.ai/models 的实时页面为准——模型价格会随提供方调整而变动。

从这张表能读出几件对选型有直接影响的事。第一,输出比输入贵得多,GPT-5.5 的输出价是输入价的六倍。所以任务形态决定了谁更划算:把一份长报告压成三百字摘要,主要成本在输入侧;反过来让模型从一句话生成几千字文档,成本几乎全压在输出侧。第二,输入价的相对差距可能比输出价更悬殊。上表里 Gemini 2.5 Pro 的输入价是另外两个的四分之一,对于重输入的检索增强场景,这个差额比模型排行榜上的名次更能左右账单。第三,上下文窗口这一栏别只看总数,GPT-5.5 那一行标的是 1M 总窗口里输入占 922K、输出占 128K,如果你的任务需要一次吐出超长内容,看总窗口数会误判。

平台侧的钱花在哪:不加价,但充值收手续费

OpenRouter 官方明确声明不对提供商定价加价,模型目录里显示的价格就是你付的价格,与提供商官网一致(来源:OpenRouter 官方 pricing 页与 FAQ)。这句话对比价很关键——它意味着你在 OpenRouter 上看到的模型单价可以直接拿去和厂商官网横向比,不用先扣一层聚合商的差价。

平台的收入来自充值环节:信用卡/借记卡(Stripe)充值收 5.5% 手续费,最低 $0.80;加密货币充值收 5%,无最低限制;企业版走发票和采购流程,条款需要另谈(来源:官方 FAQ)。所以真实的单位成本要在模型单价上乘一个约 1.055 的系数。这个系数对比价排序基本没影响(对所有模型一视同仁),但对预算估算有影响——尤其是小额多次充值时,那个 $0.80 的最低值会让小额充值的实际费率高于 5.5%,一次充够能摊薄这部分。

还有一条容易被忽略的条款:官方 FAQ 表示保留在购买满一年后清零未使用信用金的权利。促销赠送的免费额度到期规则可能更短,具体以账户内的实时提示为准。所以”趁便宜一次充一大笔”这个策略有个上限,按未来一年能用完的量充比较稳妥。

如果你手上已经有某家模型厂商的官方 key,OpenRouter 还提供自带 key(BYOK)的模式。这里要提醒一处:官方两个页面的表述口径不完全一致——FAQ 页按请求次数写(首月 100 万次 BYOK 请求免费,超出后按该模型正常价格的 5% 收平台费),pricing 页按金额写(Pay-as-you-go 每月 $25,000 等值的 list price 推理额度内免手续费,超出收 5%;Enterprise 档为每月 $200,000)。这两个口径的对应关系未能进一步核实,如果 BYOK 的费用会明显影响你的决策,请以 openrouter.ai/docs/faq 与 openrouter.ai/pricing 的当前页面为准,别拿本文的转述去做预算。

免费档:适合当筛子,不适合当生产线

OpenRouter 有一档专门的免费模型路由(openrouter/free),会在可用的免费模型里做筛选分配,官方页面显示约 26 个免费变体,多来自 Qwen、DeepSeek、Llama、Gemma 等开源模型的免费额度。

限速是分级的:没有购买过信用金的账户为每天 50 次、每分钟 20 次;账户历史充值达到 $10 及以上的,每天上限提高到 1000 次,每分钟 20 次的限制仍在(来源:官方 FAQ 与 pricing 页)。关于”免费档不适合生产环境”这个说法,是第三方转述的官方表述,未在官方原文逐字核实,这里按第三方口径转达,供参考。

从这几个数字能推出免费档的合理用法:每分钟 20 次这个限制,决定了它不适合承接有并发的线上流量;每天 50 次到 1000 次的量,倒是很适合做选型阶段的试跑——先用免费档把明显不合适的模型筛掉,剩下两三个候选再花钱做正式对比。另外免费档会在池子里动态分配模型,这对”复现同一个结果”是不利的,做严肃对比时应该固定具体模型名,别用免费路由的随机分配来下结论。

免费档的完整边界另有一篇细说:OpenRouter 的免费模型能用到什么程度

一套自己能跑的比价流程

选型这件事,最怕的是凭几次对话的手感下结论。下面这套流程不复杂,一个下午能跑完:

第一步,攒 20 到 30 条真实样本。 从你自己的业务里取,不要用网上的通用测试题。样本要覆盖典型情况和边角情况,最好包含几条你知道很难的。

第二步,先定评判标准再跑。 每条样本写下”什么样算通过”。分类任务对答案就行;生成类任务可以定几条硬性检查项,比如必须包含哪几个字段、不能出现哪类表述。标准先写死,避免跑完之后看着结果编理由。

第三步,固定模型名跑一轮。 OpenRouter 的模型名带命名空间前缀,形如 openai/xxxanthropic/xxxgoogle/xxx,接口是 OpenAI 兼容的,base_url 填 https://openrouter.ai/api/v1 即可,把候选模型换着名字跑同一批样本。注意把温度等采样参数固定住,否则两轮结果的差异可能来自随机性而不是模型差异。

第四步,记录 token 用量而不是估算。 每次调用的响应里都有实际 token 数,把它连同结果一起存下来。真实用量和你拍脑袋估的往往差一截,尤其是带思考过程的模型,输出 token 可能远超你看到的正文长度。

第五步,算出前面那个公式的结果并排序。 到这一步,“哪个划算”就是一个数了,不用再争。

跑完这一轮,通常会发现结论不是”某个模型全面胜出”,而是不同任务档位该配不同模型。这就自然过渡到分档路由的做法,可参考模型路由策略:什么任务该走哪一档

别只算钱:可用性也是成本的一部分

只按单价选,容易踩到另一个坑——便宜的模型或提供商可能不稳定,而排查线上抖动花掉的时间是实打实的成本。

OpenRouter 在这一点上有内建机制:官方 FAQ 说明,某个提供商返回错误时会自动切换到下一个可用提供商,这个过程对调用方是透明的,官方称这让生产应用更具韧性;同时官方提到对失败请求不计费(“Zero Completion Insurance”,按成功请求计费)。这个机制的意义在于,选型时可以把”这家提供商偶尔抖一下”的权重适当调低,因为有兜底路径。但它兜的是提供商级别的故障,不兜”模型答得不对”——回退到另一家之后,模型的能力还是那个能力。

需要留意的是,回退发生时你实际付费的可能是另一条链路上的价格,账单和你预期的最优价会有出入。如果你对成本敏感,值得定期核一下实际账单构成,别只看理论单价。相关的额度与用量管理可参考OpenRouter 额度怎么管,接入细节见OpenRouter API 怎么接入

这套方法的局限

说几条本文帮不上忙的地方,免得当成万能公式:

  • 价格变动快。 本文引用的三个代表型号价格是 2026-07 从官方模型页核到的快照,提供商调价后就不准了。做正式预算前请重新核一遍 openrouter.ai/models。
  • 达标率依赖你的样本。 20 条样本给出的排序,换一批业务数据可能翻转。这套流程的价值在于可复现,不在于一次跑完永久有效,建议每次模型换代后重跑。
  • 没有覆盖延迟和吞吐。 交互式产品里首字延迟的权重可能高于单价,本文的公式没把这一项算进去,需要的话得单独测。
  • 大陆访问是前置问题。 OpenRouter 是境外托管的服务,官网和 API 端点都在海外,这是同类海外聚合平台以及其底层依赖的 OpenAI、Anthropic、Google 等厂商的共同情况。以各厂商官方公布的受支持地区为准;本文不提供也不背书任何第三方中转渠道,此类服务的合规性与稳定性风险由使用者自负。如果这条路走不通,先解决准入问题再谈比价,否则测出来的结论落不了地。

补充:选型时可用的几个官方机制

前面那套比价方法针对的是「全量模型(含付费)怎么选」。如果你的范围只限于免费池,挑法不一样——免费档要权衡的是限速与可用性而不是单价,那部分单独写在OpenRouter 免费模型推荐里,两篇是分工关系,别混着用。

把选择权交出去:openrouter/auto 官方提供了一个 Auto Router:modelopenrouter/auto,它会先用一个轻量分类器判断这条 prompt 属于哪类任务,再查社区在这类任务上的花费份额排名,套用你指定的成本档(cost_tier,官方从便宜到强列出的取值是 lowmediumhighxhighmax),最后排出「主选 + 若干 fallback」。它不是一个更聪明的模型,而是把市场行为当排序信号的选择器。没设成本相关参数时,官方说会按大致相当于 low 那一档的方式路由(默认行为以官方文档当前版本为准)。机制细节见OpenRouter Auto Router 是怎么选模型的

别把 order 当筛子用。 选型落地时常见的一个误解:provider.order 只是优先级排序,官方的措辞是「按这个列表和顺序优先尝试」,它不会把候选池筛空。真正会限定候选范围的是 provider.only;而 preferred_min_throughput / preferred_max_latency 这两个只降权、不排除,官方明说它们永远不会导致请求无法执行。搞混这几个,排查「为什么没有可用供应商」时方向就全错了。

用 latest 别名减少维护成本。 ~author/family-latest 这类别名会解析到该系列当前最新的对应模型,好处是不用重新部署就能跟上版本;代价是你放弃了版本锁定,回归测试的基线会飘。要不要用,取决于你的场景更怕过时还是更怕不可复现。

成本之外还有一层:额度本身会过期。 按官方服务条款,平台保留在购买后一段时间内作废未使用额度的权利。这意味着「一次充够省手续费」并不总是划算——闲置额度有沉没风险。这笔账怎么算,见OpenRouter 充值手续费是怎么产生的

小结

在 OpenRouter 上选模型,把问题从”哪个模型好”改成”我这个任务每次可用产出要花多少钱”,选择立刻就有了标准。输入价和输出价要分开算,因为任务形态决定了成本压在哪一侧。平台侧不对模型调用加价,钱收在充值手续费上,估预算时记得把这层加回去。免费档更适合当筛选工具而不是生产线,选型对比时应固定具体模型名。最后,跑一轮 20 到 30 条真实样本、先定标准再看结果,比任何排行榜都更贴近你自己的账单。

接下来看什么

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。

留言讨论

评论发布后会被人工复核,违规内容将被删除。

    还没有人评论,来说说你的看法

    如果发表没有反应,可以前往联系我们告诉我们。

    OpenRouter 充值不方便?

    国内直连的 OpenAI 兼容端点,一期提供 DeepSeek,注册送 ¥5。

    看替代方案

    这个页面有问题?

    提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。