DeepSeek V4 Pro 和 Flash 的区别:Flash 已升级成 V4.1,模型名也换了

2026-09-28

如果你正准备调 DeepSeek 的 API,要在 V4 Pro 和 Flash 之间选一个,先知道一个变化:

Flash 已经不是 V4 了。 DeepSeek 官方文档现在写的是:Flash 对应的模型版本是 DeepSeek-V4.1-Flash,模型名请使用 deepseek-flash。你代码里如果还写着 deepseek-v4-flash,请求照样能成功,但背后服务你的已经是 V4.1-Flash,并按 Flash 的价格计费。

所以现在比的,其实是 V4.1-Flash 和 V4-Pro。

本文所有信息来自 DeepSeek 官方 API 文档的「模型与价格」页和「思考模式」页,核对日期 2026-09-28。价格会变,文中只写计费机制和两者的相对关系,具体单价以官方页为准。

一、先看一张表:哪些一样,哪些不一样

项目deepseek-flashdeepseek-v4-pro
模型版本DeepSeek-V4.1-FlashDeepSeek-V4-Pro-0813
上下文长度1M1M
最大输出长度384K384K
思考模式支持思考与非思考,默认思考同左
JSON Output / Tool Calls支持支持
Responses API / Anthropic API 格式支持支持
对话前缀续写(Beta)支持支持
FIM 补全(Beta)仅非思考模式仅非思考模式
图像理解支持不支持
并发上限高更低(约为 Flash 的 1/5)
单价低三个计费项都更高

一句话概括:能力开关几乎完全一样,差别集中在三处——能不能看图、能同时跑多少请求、每个 token 多少钱。

二、三处真正的差别

1. 图像理解:只有 Flash 有

这是官方表格里唯一一项「一个支持、一个不支持」的功能。如果你的场景要把截图、图表、照片传给模型,现在只能用 deepseek-flash。

顺带一提,官方说明里提到旧模型名 deepseek-v4-flash-vision-exp 也还能调用,同样由 V4.1-Flash 服务。以前用过这个实验名的,可以直接换成 deepseek-flash。

2. 并发上限:Flash 更高

官方表格给两者列了不同的并发限制,Pro 约为 Flash 的五分之一。具体数字和规则见官方「限速与隔离」页,那里会随调整更新。

这一项对批量任务影响很大:同样是跑几千条数据,并发上限决定了你一次能同时发出多少请求。用 Pro 做批量时,建议在客户端自己控制并发数,别撞到上限。

3. 单价:Pro 三个计费项都更贵

DeepSeek 按三个计费项收费:输入(缓存命中)、输入(缓存未命中)、输出。官方价格表里,Pro 在这三项上都比 Flash 贵,按官方价格表约为 Flash 的 3.4 到 7.5 倍。

另外有一条两者共用的现行规则:分时计费。官方原文是:

空闲时段价格为高峰时段价格的一半。北京时间周一至周五(不含中国法定节假日)9:00 - 12:00、14:00 - 18:00 为高峰时段;其余时段,包括周末及中国法定节假日全天均为空闲时段。

也就是说,同一个模型,在空闲时段跑只要高峰时段一半的价钱。空闲时段不只是晚上和周末:工作日的 12:00–14:00、18:00 以后、9:00 以前,以及法定节假日全天都算。能挪时间的批量任务,挪到空闲时段是最直接的省钱办法,而且 Flash 和 Pro 都适用。

三、思考模式:两者用法一样

两个模型都默认开启思考模式,也都能关掉。按官方「思考模式」页,开关和强度在不同接口格式下的写法是:

接口格式开关思考强度
OpenAI 格式{"thinking": {"type": "enabled/disabled"}}{"reasoning_effort": "low/high/max"}
Anthropic 格式同上{"output_config": {"effort": "low/high/max"}}
Responses API 格式{"reasoning": {"effort": "none/low/high/max"}},none 即关闭同左

默认强度是 high。用 OpenAI SDK 调 Chat Completions 时,thinking 参数要放进 extra_body 里传。

有三个细节容易踩:

  • 思考模式下 temperature、presence_penalty、frequency_penalty 不生效,传了也不报错;
  • top_p 只在思考模式下生效,低于 0.95 的值会按 0.95 处理;
  • FIM 补全只能在非思考模式下用,要用补全功能得先把思考关掉。

四、怎么选

官方文档只写了上面这些可以核对的差异,没有给出两者在回答质量上的对比。所以下面的建议只基于能核对的事实:

  • 要传图片:只能选 Flash。
  • 批量跑、并发高:优先 Flash,并发上限的差距是硬约束。
  • 预算敏感:Flash 三项单价都更低;不管选哪个,能挪到空闲时段就挪。
  • 想要 Pro:拿你自己的真实任务,两个模型各跑一批,对比结果质量和总花费再决定。Pro 更贵,值不值只能用你的任务来验证,别看名字下结论。

五、已经在用的人要检查什么

  1. 代码里的模型名:deepseek-v4-flash 还能用,但建议改成官方现在推荐的 deepseek-flash,免得哪天旧名停用时措手不及。
  2. 成本估算:如果你之前按「全天一个价」估算过月度费用,按现行的分时计费,工作日高峰时段的请求比例会直接影响账单。
  3. 扣费顺序:官方写明,充值余额和赠送余额同时存在时,优先扣赠送余额。

相关阅读

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。

留言讨论

评论发布后会被人工复核,违规内容将被删除。

    还没有人评论,来说说你的看法

    如果发表没有反应,可以前往联系我们告诉我们。

    这个页面有问题?

    提交时会附带当前页面地址和浏览器信息,帮助我们定位问题。不填联系方式即为匿名。