OpenRouter 上怎么挑性价比模型?一套可复现的比价方法
数据截至 2026-07,价格与限额以各官网为准。
在 OpenRouter 上挑模型,比”哪个模型最强”更有用的问题是”我这个任务的单位产出成本是多少”。同一个价目表,做长文摘要和做代码补全算出来的账完全不同——因为前者烧输入 token,后者烧输出 token,而这两项在几乎所有模型上都不是一个价。
常见的误解是把模型页上那一行”每百万 token 多少美元”当成性价比排序的唯一依据,挑一个数字最低的接上去用。真按这个逻辑选,很容易出现两种结果:一是便宜模型答不对,重试两三次反而更贵;二是账单跟预估对不上,因为忽略了输出价、上下文长度和平台侧的充值手续费。这篇把这几层拆开说,顺便给一套自己就能跑的比价流程。
先把”性价比”翻译成一个能算的公式
OpenRouter 的定位是海外的模型聚合平台:一个 API key、一套 OpenAI 兼容接口,就能调到上百个模型,涵盖 OpenAI、Anthropic、Google 的闭源系列以及 Qwen、DeepSeek、Llama、Gemma 等一批开源模型,平台还会自动处理故障转移和路由(来源:OpenRouter 官方 quickstart 文档)。选择面一大,“挑便宜的”这个动作反而没了边界。
可执行的做法是把性价比落到三个数上:
- 单次任务的输入 token 数——你的 prompt 加上下文、检索到的资料、历史对话,大致有多少。
- 单次任务的输出 token 数——期望模型回多长。做分类可能只有几十个 token,写文档可能几千。
- 达标率——同一批样本跑下来,有多少次结果是不用人工返工的。
然后算:单次成本 = 输入token/1M × 输入价 + 输出token/1M × 输出价,再除以达标率,得到”每一次可用产出的成本”。这个数才是能横向比的。一个单价便宜三成但达标率只有六成的模型,实际比贵的那个还费钱,而且多花的人工核对时间没算进去。
输入价和输出价要分开看,别只盯一个数
官方模型页对每个模型分别标输入价和输出价,两者差距通常不小。以 2026-07 从 OpenRouter 官方模型页直接核到的三个代表型号为例:
| 模型 | 输入(每百万 token) | 输出(每百万 token) | 上下文窗口 |
|---|---|---|---|
| OpenAI GPT-5.5 | $5 | $30 | 1M(922K 输入 + 128K 输出) |
| Anthropic Claude Opus 4.7 | $5 | $25 | 1M |
| Google Gemini 2.5 Pro | $1.25 | $10 | 1M |
这三行是官方模型页当次核实所得,其余型号的价格请以 openrouter.ai/models 的实时页面为准——模型价格会随提供方调整而变动。
从这张表能读出几件对选型有直接影响的事。第一,输出比输入贵得多,GPT-5.5 的输出价是输入价的六倍。所以任务形态决定了谁更划算:把一份长报告压成三百字摘要,主要成本在输入侧;反过来让模型从一句话生成几千字文档,成本几乎全压在输出侧。第二,输入价的相对差距可能比输出价更悬殊。上表里 Gemini 2.5 Pro 的输入价是另外两个的四分之一,对于重输入的检索增强场景,这个差额比模型排行榜上的名次更能左右账单。第三,上下文窗口这一栏别只看总数,GPT-5.5 那一行标的是 1M 总窗口里输入占 922K、输出占 128K,如果你的任务需要一次吐出超长内容,看总窗口数会误判。
平台侧的钱花在哪:不加价,但充值收手续费
OpenRouter 官方明确声明不对提供商定价加价,模型目录里显示的价格就是你付的价格,与提供商官网一致(来源:OpenRouter 官方 pricing 页与 FAQ)。这句话对比价很关键——它意味着你在 OpenRouter 上看到的模型单价可以直接拿去和厂商官网横向比,不用先扣一层聚合商的差价。
平台的收入来自充值环节:信用卡/借记卡(Stripe)充值收 5.5% 手续费,最低 $0.80;加密货币充值收 5%,无最低限制;企业版走发票和采购流程,条款需要另谈(来源:官方 FAQ)。所以真实的单位成本要在模型单价上乘一个约 1.055 的系数。这个系数对比价排序基本没影响(对所有模型一视同仁),但对预算估算有影响——尤其是小额多次充值时,那个 $0.80 的最低值会让小额充值的实际费率高于 5.5%,一次充够能摊薄这部分。
还有一条容易被忽略的条款:官方 FAQ 表示保留在购买满一年后清零未使用信用金的权利。促销赠送的免费额度到期规则可能更短,具体以账户内的实时提示为准。所以”趁便宜一次充一大笔”这个策略有个上限,按未来一年能用完的量充比较稳妥。
如果你手上已经有某家模型厂商的官方 key,OpenRouter 还提供自带 key(BYOK)的模式。这里要提醒一处:官方两个页面的表述口径不完全一致——FAQ 页按请求次数写(首月 100 万次 BYOK 请求免费,超出后按该模型正常价格的 5% 收平台费),pricing 页按金额写(Pay-as-you-go 每月 $25,000 等值的 list price 推理额度内免手续费,超出收 5%;Enterprise 档为每月 $200,000)。这两个口径的对应关系未能进一步核实,如果 BYOK 的费用会明显影响你的决策,请以 openrouter.ai/docs/faq 与 openrouter.ai/pricing 的当前页面为准,别拿本文的转述去做预算。
免费档:适合当筛子,不适合当生产线
OpenRouter 有一档专门的免费模型路由(openrouter/free),会在可用的免费模型里做筛选分配,官方页面显示约 26 个免费变体,多来自 Qwen、DeepSeek、Llama、Gemma 等开源模型的免费额度。
限速是分级的:没有购买过信用金的账户为每天 50 次、每分钟 20 次;账户历史充值达到 $10 及以上的,每天上限提高到 1000 次,每分钟 20 次的限制仍在(来源:官方 FAQ 与 pricing 页)。关于”免费档不适合生产环境”这个说法,是第三方转述的官方表述,未在官方原文逐字核实,这里按第三方口径转达,供参考。
从这几个数字能推出免费档的合理用法:每分钟 20 次这个限制,决定了它不适合承接有并发的线上流量;每天 50 次到 1000 次的量,倒是很适合做选型阶段的试跑——先用免费档把明显不合适的模型筛掉,剩下两三个候选再花钱做正式对比。另外免费档会在池子里动态分配模型,这对”复现同一个结果”是不利的,做严肃对比时应该固定具体模型名,别用免费路由的随机分配来下结论。
免费档的完整边界另有一篇细说:OpenRouter 的免费模型能用到什么程度。
一套自己能跑的比价流程
选型这件事,最怕的是凭几次对话的手感下结论。下面这套流程不复杂,一个下午能跑完:
第一步,攒 20 到 30 条真实样本。 从你自己的业务里取,不要用网上的通用测试题。样本要覆盖典型情况和边角情况,最好包含几条你知道很难的。
第二步,先定评判标准再跑。 每条样本写下”什么样算通过”。分类任务对答案就行;生成类任务可以定几条硬性检查项,比如必须包含哪几个字段、不能出现哪类表述。标准先写死,避免跑完之后看着结果编理由。
第三步,固定模型名跑一轮。 OpenRouter 的模型名带命名空间前缀,形如 openai/xxx、anthropic/xxx、google/xxx,接口是 OpenAI 兼容的,base_url 填 https://openrouter.ai/api/v1 即可,把候选模型换着名字跑同一批样本。注意把温度等采样参数固定住,否则两轮结果的差异可能来自随机性而不是模型差异。
第四步,记录 token 用量而不是估算。 每次调用的响应里都有实际 token 数,把它连同结果一起存下来。真实用量和你拍脑袋估的往往差一截,尤其是带思考过程的模型,输出 token 可能远超你看到的正文长度。
第五步,算出前面那个公式的结果并排序。 到这一步,“哪个划算”就是一个数了,不用再争。
跑完这一轮,通常会发现结论不是”某个模型全面胜出”,而是不同任务档位该配不同模型。这就自然过渡到分档路由的做法,可参考模型路由策略:什么任务该走哪一档。
别只算钱:可用性也是成本的一部分
只按单价选,容易踩到另一个坑——便宜的模型或提供商可能不稳定,而排查线上抖动花掉的时间是实打实的成本。
OpenRouter 在这一点上有内建机制:官方 FAQ 说明,某个提供商返回错误时会自动切换到下一个可用提供商,这个过程对调用方是透明的,官方称这让生产应用更具韧性;同时官方提到对失败请求不计费(“Zero Completion Insurance”,按成功请求计费)。这个机制的意义在于,选型时可以把”这家提供商偶尔抖一下”的权重适当调低,因为有兜底路径。但它兜的是提供商级别的故障,不兜”模型答得不对”——回退到另一家之后,模型的能力还是那个能力。
需要留意的是,回退发生时你实际付费的可能是另一条链路上的价格,账单和你预期的最优价会有出入。如果你对成本敏感,值得定期核一下实际账单构成,别只看理论单价。相关的额度与用量管理可参考OpenRouter 额度怎么管,接入细节见OpenRouter API 怎么接入。
这套方法的局限
说几条本文帮不上忙的地方,免得当成万能公式:
- 价格变动快。 本文引用的三个代表型号价格是 2026-07 从官方模型页核到的快照,提供商调价后就不准了。做正式预算前请重新核一遍 openrouter.ai/models。
- 达标率依赖你的样本。 20 条样本给出的排序,换一批业务数据可能翻转。这套流程的价值在于可复现,不在于一次跑完永久有效,建议每次模型换代后重跑。
- 没有覆盖延迟和吞吐。 交互式产品里首字延迟的权重可能高于单价,本文的公式没把这一项算进去,需要的话得单独测。
- 大陆访问是前置问题。 OpenRouter 是境外托管的服务,官网和 API 端点都在海外,这是同类海外聚合平台以及其底层依赖的 OpenAI、Anthropic、Google 等厂商的共同情况。以各厂商官方公布的受支持地区为准;本文不提供也不背书任何第三方中转渠道,此类服务的合规性与稳定性风险由使用者自负。如果这条路走不通,先解决准入问题再谈比价,否则测出来的结论落不了地。
小结
在 OpenRouter 上选模型,把问题从”哪个模型好”改成”我这个任务每次可用产出要花多少钱”,选择立刻就有了标准。输入价和输出价要分开算,因为任务形态决定了成本压在哪一侧。平台侧不对模型调用加价,钱收在充值手续费上,估预算时记得把这层加回去。免费档更适合当筛选工具而不是生产线,选型对比时应固定具体模型名。最后,跑一轮 20 到 30 条真实样本、先定标准再看结果,比任何排行榜都更贴近你自己的账单。