DeepSeek V4 Pro 和 Flash 的区别:Flash 已升级成 V4.1,模型名也换了
如果你正准备调 DeepSeek 的 API,要在 V4 Pro 和 Flash 之间选一个,先知道一个变化:
Flash 已经不是 V4 了。 DeepSeek 官方文档现在写的是:Flash 对应的模型版本是 DeepSeek-V4.1-Flash,模型名请使用 deepseek-flash。你代码里如果还写着 deepseek-v4-flash,请求照样能成功,但背后服务你的已经是 V4.1-Flash,并按 Flash 的价格计费。
所以现在比的,其实是 V4.1-Flash 和 V4-Pro。
本文所有信息来自 DeepSeek 官方 API 文档的「模型与价格」页和「思考模式」页,核对日期 2026-09-28。价格会变,文中只写计费机制和两者的相对关系,具体单价以官方页为准。
一、先看一张表:哪些一样,哪些不一样
| 项目 | deepseek-flash | deepseek-v4-pro |
|---|---|---|
| 模型版本 | DeepSeek-V4.1-Flash | DeepSeek-V4-Pro-0813 |
| 上下文长度 | 1M | 1M |
| 最大输出长度 | 384K | 384K |
| 思考模式 | 支持思考与非思考,默认思考 | 同左 |
| JSON Output / Tool Calls | 支持 | 支持 |
| Responses API / Anthropic API 格式 | 支持 | 支持 |
| 对话前缀续写(Beta) | 支持 | 支持 |
| FIM 补全(Beta) | 仅非思考模式 | 仅非思考模式 |
| 图像理解 | 支持 | 不支持 |
| 并发上限 | 高 | 更低(约为 Flash 的 1/5) |
| 单价 | 低 | 三个计费项都更高 |
一句话概括:能力开关几乎完全一样,差别集中在三处——能不能看图、能同时跑多少请求、每个 token 多少钱。
二、三处真正的差别
1. 图像理解:只有 Flash 有
这是官方表格里唯一一项「一个支持、一个不支持」的功能。如果你的场景要把截图、图表、照片传给模型,现在只能用 deepseek-flash。
顺带一提,官方说明里提到旧模型名 deepseek-v4-flash-vision-exp 也还能调用,同样由 V4.1-Flash 服务。以前用过这个实验名的,可以直接换成 deepseek-flash。
2. 并发上限:Flash 更高
官方表格给两者列了不同的并发限制,Pro 约为 Flash 的五分之一。具体数字和规则见官方「限速与隔离」页,那里会随调整更新。
这一项对批量任务影响很大:同样是跑几千条数据,并发上限决定了你一次能同时发出多少请求。用 Pro 做批量时,建议在客户端自己控制并发数,别撞到上限。
3. 单价:Pro 三个计费项都更贵
DeepSeek 按三个计费项收费:输入(缓存命中)、输入(缓存未命中)、输出。官方价格表里,Pro 在这三项上都比 Flash 贵,按官方价格表约为 Flash 的 3.4 到 7.5 倍。
另外有一条两者共用的现行规则:分时计费。官方原文是:
空闲时段价格为高峰时段价格的一半。北京时间周一至周五(不含中国法定节假日)9:00 - 12:00、14:00 - 18:00 为高峰时段;其余时段,包括周末及中国法定节假日全天均为空闲时段。
也就是说,同一个模型,在空闲时段跑只要高峰时段一半的价钱。空闲时段不只是晚上和周末:工作日的 12:00–14:00、18:00 以后、9:00 以前,以及法定节假日全天都算。能挪时间的批量任务,挪到空闲时段是最直接的省钱办法,而且 Flash 和 Pro 都适用。
三、思考模式:两者用法一样
两个模型都默认开启思考模式,也都能关掉。按官方「思考模式」页,开关和强度在不同接口格式下的写法是:
| 接口格式 | 开关 | 思考强度 |
|---|---|---|
| OpenAI 格式 | {"thinking": {"type": "enabled/disabled"}} | {"reasoning_effort": "low/high/max"} |
| Anthropic 格式 | 同上 | {"output_config": {"effort": "low/high/max"}} |
| Responses API 格式 | {"reasoning": {"effort": "none/low/high/max"}},none 即关闭 | 同左 |
默认强度是 high。用 OpenAI SDK 调 Chat Completions 时,thinking 参数要放进 extra_body 里传。
有三个细节容易踩:
- 思考模式下
temperature、presence_penalty、frequency_penalty不生效,传了也不报错; top_p只在思考模式下生效,低于 0.95 的值会按 0.95 处理;- FIM 补全只能在非思考模式下用,要用补全功能得先把思考关掉。
四、怎么选
官方文档只写了上面这些可以核对的差异,没有给出两者在回答质量上的对比。所以下面的建议只基于能核对的事实:
- 要传图片:只能选 Flash。
- 批量跑、并发高:优先 Flash,并发上限的差距是硬约束。
- 预算敏感:Flash 三项单价都更低;不管选哪个,能挪到空闲时段就挪。
- 想要 Pro:拿你自己的真实任务,两个模型各跑一批,对比结果质量和总花费再决定。Pro 更贵,值不值只能用你的任务来验证,别看名字下结论。
五、已经在用的人要检查什么
- 代码里的模型名:
deepseek-v4-flash还能用,但建议改成官方现在推荐的deepseek-flash,免得哪天旧名停用时措手不及。 - 成本估算:如果你之前按「全天一个价」估算过月度费用,按现行的分时计费,工作日高峰时段的请求比例会直接影响账单。
- 扣费顺序:官方写明,充值余额和赠送余额同时存在时,优先扣赠送余额。
相关阅读
留言讨论
评论发布后会被人工复核,违规内容将被删除。
如果发表没有反应,可以前往联系我们告诉我们。