Kimi / Moonshot API 多少钱?K2 等模型 token 单价与省钱用法
数据截至 2026-07,价格与限额以各官网为准。
Kimi(Moonshot)API 按 token 计费,输入 token 又分”缓存命中”和”未命中”两种单价,两者能差 5-6 倍;真正决定账单的不是表面单价,而是你的请求有没有命中自动缓存、选的模型档位对不对。搞懂这两点,同样的活儿成本能差出好几倍。
先说一件容易踩坑的事:Kimi 的官方入口最近改了名字。很多人还在按老印象找 moonshot.cn,其实现在已经是另一套域名了,模型清单也换了一批。这篇先把入口和现状理清楚,再讲计费和省钱。
官方域名已经迁移,别按老地址找
如果你之前用过 Kimi API,可能对 platform.moonshot.cn 这个域名有印象。现在打开会发现它已经 301 永久跳转到了 platform.kimi.com——这是大陆/人民币计价站。国际版同理,platform.moonshot.ai 跳转到了 platform.kimi.ai,走美元计价。
这两个站不是同一套账户互通的两个入口,而是同一产品对应的两套独立账户体系:一套走人民币结算,base_url 对应 api.moonshot.cn;一套走美元结算,base_url 对应 api.moonshot.ai。哪套 key 能不能跨站用,官方没有明确说明,稳妥的做法是按你实际注册的那个站点走到底,别中途混用。如果你是老用户,建议直接去新域名重新确认一下账户信息,免得对着一个已经跳转的旧地址反复排查”为什么打不开”。
顺带说一句模型迭代的事:如果你看到教程里提到 kimi-k2、kimi-k2-0711-preview、kimi-k2-thinking 这类名字,那是旧版本。官方已经在 2026-05-25 把这几个模型下线,建议迁移的目标是 kimi-k2.6。现在的主力阵容是 K2.7 系列(含代码专用版)和 K2.6、K2.5,下面的价格表也只列这几个当前在售的。
各模型单价表
Kimi 的计费单位和大多数大模型 API 一样,按每百万 token(不管中文还是英文,统一按 token 数算)计价,输入和输出分开算钱。但 Kimi 有个跟不少家不太一样的地方:输入价格本身又拆成了”缓存命中”和”缓存未命中”两档,而且这套缓存是自动生效的,不需要你在代码里手动开启或指定断点。
先看大陆站(platform.kimi.com,人民币计价,单位是元/百万 token):
| 模型 | 上下文长度 | 输入·缓存命中 | 输入·未命中 | 输出价 |
|---|---|---|---|---|
kimi-k2.7-code(当前主打的编程专用模型) | 262,144 | ¥1.30 | ¥6.50 | ¥27.00 |
kimi-k2.7-code-highspeed(高速版,约 180-260 tokens/s) | 262,144 | ¥2.60 | ¥13.00 | ¥54.00 |
kimi-k2.6(当前旗舰多模态,文本+图片+视频) | 262,144 | ¥1.10 | ¥6.50 | ¥27.00 |
kimi-k2.5(上一代旗舰,仍在售,性价比更高) | 262,144 | ¥0.70 | ¥4.00 | ¥21.00 |
再看国际站(platform.kimi.ai,美元计价,单位是美元/百万 token):
| 模型 | 上下文长度 | 输入·缓存命中 | 输入·未命中 | 输出价 |
|---|---|---|---|---|
kimi-k2.7-code | 262,144 | $0.19 | $0.95 | $4.00 |
kimi-k2.7-code-highspeed | 262,144 | $0.38 | $1.90 | $8.00 |
kimi-k2.6 | 262,144 | $0.16 | $0.95 | $4.00 |
kimi-k2.5 | 262,144 | $0.10 | $0.60 | $3.00 |
读表的几个要点。第一,输出价明显比输入贵——无论哪个模型,输出价都在未命中输入价的 4 倍上下,跟 Claude、GPT 那套”输出比输入贵”的规律是一致的,长文本生成、代码生成这类输出量大的任务成本占比会很重。第二,缓存命中和未命中的差距很大,大陆站基本是 5 倍左右(比如 K2.6 是 ¥1.10 对 ¥6.50),国际站差距更夸张(K2.6 是 $0.16 对 $0.95,差不多 6 倍)。这意味着同一个请求,命中和不命中缓存,输入这一项的花费可以差出好几倍,比很多人想象的影响要大。第三,kimi-k2.7-code-highspeed 是用价格换速度的版本,单价接近普通版的 2 倍,只有对延迟特别敏感的场景才值得多付这份钱。
另外还有一类经典的 moonshot-v1-8k/32k/128k 系列(含视觉版),这几档除了上下文长度不同,能力没有差异,具体价格官方放在单独的 /docs/pricing/chat-v1 页面,本文没有核实到确切数字,需要用这条产品线的话请直接去官网查当次价格。
OpenAI 兼容调用,换个 base_url 就行
Kimi API 的一个实际优点是完全兼容 OpenAI 的 Python SDK,如果你之前写过 OpenAI 或者其他兼容 OpenAI 接口的调用代码,迁移过来几乎不用改逻辑,只需要换 base_url 和 api_key。
大陆站的最小示例(来自官方 quickstart 文档):
from openai import OpenAI
client = OpenAI(
api_key="$MOONSHOT_API_KEY",
base_url="https://api.moonshot.cn/v1",
)
completion = client.chat.completions.create(
model="kimi-k2.6",
messages=[{"role": "user", "content": "你好"}]
)
print(completion.choices[0].message.content)
国际站只需要把 base_url 换成 https://api.moonshot.ai/v1,其余代码一字不改。密钥申请也很直接:登录 platform.kimi.com,控制台左栏找到「API Key 管理」,点新建,立即复制保存——这个 key 只显示一次,关掉弹窗前一定要存好。
如果你想在代码里动态确认某个模型支持什么能力(比如是否支持传图片、是否支持推理模式),可以调用官方的 GET https://api.moonshot.cn/v1/models,返回里会带 context_length、supports_image_in、supports_video_in、supports_reasoning 这些字段,比翻文档更省事。
月成本怎么估算
估算方法和其他家 token 计费的 API 大同小异,公式是:
单次成本 = 输入 token 数 / 1,000,000 × 对应输入单价(命中或未命中)
+ 输出 token 数 / 1,000,000 × 输出单价
月成本 ≈ 单次成本 × 每月请求数
举个例子,用 kimi-k2.6(大陆站,人民币计价)做一个客服问答功能,假设每次请求输入 2,000 token、输出 500 token,每天 2,000 次请求,先算一个”完全没命中缓存”的悲观场景:
- 单次输入成本:2,000 / 1,000,000 × ¥6.50 = ¥0.013
- 单次输出成本:500 / 1,000,000 × ¥27.00 = ¥0.0135
- 单次合计:约 ¥0.0265
- 每天 2,000 次:约 ¥53
- 一个月(30 天):约 ¥1,590
同样的负载,如果系统提示和参考资料是固定的、大部分请求都命中了缓存(假设命中率 80%):
- 命中部分输入成本:2,000 × 0.8 / 1,000,000 × ¥1.10 ≈ ¥0.00176
- 未命中部分输入成本:2,000 × 0.2 / 1,000,000 × ¥6.50 ≈ ¥0.0026
- 加上输出成本 ¥0.0135,单次合计约 ¥0.0179
- 一个月:约 ¥1,074
同一套负载,命中率从 0 提到 80%,账单能省下三成多——这还只是一个 2,000 输入 token 的中等场景,请求里固定内容占比越高、命中率越高,省下来的比例就越大。估算时的可靠做法是先跑一批真实样本,记录 usage 字段里到底命中了多少、没命中多少,再按实测比例套公式,别拍脑袋按 100% 命中算——那样容易把成本估得虚低,实际上线后被账单反打脸。
想理解”该盯哪些成本指标”而不是只盯着调用量刷数字,可以参考 把 Token 当 KPI:AI 转型最贵的坑,讲的是更宏观的误区,跟这里的单价计算是两个层面但互相有关。
省钱调用法
单价改不了,但下面几件事能实打实压低账单。
一、把固定内容做成能命中缓存的前缀
Kimi 的自动上下文缓存不需要额外开启,但要真正吃到那 5-6 倍的差价,你的请求结构需要配合它——把不变的部分(系统提示、参考文档、few-shot 示例)放在请求最前面,把每次都变化的用户输入放在后面。缓存本质上是按前缀匹配的,前面任何一处发生变化,后面就没法复用了。如果你的代码里把系统提示和用户消息顺序打乱、或者每次都往系统提示里塞一点动态内容(比如当前时间戳),缓存会一直命不中,白白多付好几倍的输入钱却不自知。
排查方式很直接:看响应里 usage 字段的命中和未命中 token 数是不是符合预期,而不是假设它”应该”在命中。
二、别默认用高速版
kimi-k2.7-code-highspeed 单价接近普通版的 2 倍,只有对首字延迟或生成速度特别敏感的场景(比如需要实时打字机效果的交互产品)才值得多花这份钱。批量任务、离线处理这类不在乎快几秒的场景,用普通版就够,把钱省下来。
三、按任务难度选模型档位,别一个模型打天下
K2.7 Code 定位是编程任务,K2.6 是通用多模态旗舰,K2.5 是上一代但仍在售、价格更低。如果你的任务只是简单的文本分类、摘要、意图识别,没必要上最新最贵的 K2.7,K2.5 或者更轻量的选项性价比更高。实操建议是先拿一批真实样本人工对比几个档位的输出质量,再决定生产环境默认走哪个,而不是想当然选”最新的肯定最好”。
四、留意联网搜索工具的额外收费
如果你的应用调用了 Kimi 的联网搜索工具(web_search),大陆站文档明确写了会额外收费 ¥0.03/次——但前提是这次调用最终确实触发了搜索(finish_reason 是 tool_calls 且真的调用了);如果模型最后是以 stop 结束、没有实际发起搜索,就不收这笔钱。如果你的应用大量挂载了联网搜索工具但很多请求其实用不上,这笔小钱积少成多也会在月账单里体现出来,值得留意工具调用的触发频率。
五、批量任务留意 Batch API
官方文档提供了独立的批量推理定价页(/docs/pricing/batch),有折扣,但具体折扣比例本文没有核实到确切数字。如果你的任务是离线批量处理、不需要实时返回,去官网这个页面查一下当次的具体折扣,大概率比同步调用划算。
常见坑 / 注意
- 域名已经改了:
moonshot.cn/moonshot.ai会跳转到kimi.com/kimi.ai,别再按老印象死记旧域名,账户体系两边不通用。 - 旧模型已下线:
kimi-k2、kimi-k2-thinking等系列 2026-05-25 已停止维护,新文章、新代码都别再往这些名字上写。 - 缓存命中差价很大:大陆站约 5 倍、国际站约 6 倍,请求结构没设计好(固定内容不在前缀)会白白多付钱。
- 高速版是加价买延迟:日常批量任务别默认选 highspeed。
- 联网搜索工具单独计费:¥0.03/次,只在真正触发搜索时收取,注意工具触发频率。
- moonshot-v1 系列价格未核实:需要用经典系列,价格以官网
/docs/pricing/chat-v1当次页面为准。 - 两套账户体系区分币种:CNY 站和 USD 站是两套账户,别假设 key 能跨站通用。