跳到主内容
算盘
选型2026-06-10 发布 · 约 8 分钟读完

DeepSeek V4 API 成本完全指南:Flash 和 Pro 怎么选

DeepSeek V4 分 Flash 与 Pro 两档,并按北京时间分时:Flash 峰时 ¥3/¥9、空闲 ¥1.5/¥4.5;Pro 峰时 ¥9/¥27、空闲 ¥4.5/¥13.5。两档上下文均为 1,000,000 tokens,最大输出 384,000 tokens;Pro 在每个时段都是 Flash 的三倍。

本文按四个问题展开:Flash 和 Pro 怎么分工;峰时/空闲缓存价在真实业务里意味着什么;V3.2 老项目迁移后的账单变化;以及与 GPT-5.5、Qwen3.5 Flash、GLM-4.7 的横向成本。所有默认预算使用峰时价,只有明确安排在空闲时段的调用才使用空闲价。

V4 Flash 缓存命中峰时 ¥0.10、空闲 ¥0.05,分别对应同一时段输入价的约 1/30。高命中场景要同时带入命中率与时段,不能把空闲价或缓存价当成全天输入价。

先看报价单:Flash 和 Pro 只差在模型能力

规格层面两档没有任何差异:1M 上下文意味着一次能塞进整个中型代码库或几百页文档;384K 最大输出是目前主流模型里最大的一档(对比 GPT-5.5 的 128K、多数国产模型的 16K 上下),长报告生成、整库重构这类任务不需要切片拼接再缝合。

价格上 Pro 在峰时、空闲与缓存命中三项都是 Flash 的三倍。规格相同,但调用时段会让两档价格整体变化一倍;成本模型至少要包含模型档位、时段、输入输出量和缓存命中率。

如果拿不准,先用 Flash 跑评测集,把不达标的子任务路由到 Pro。若 30% 请求走 Pro、70% 走 Flash,输入均价峰时为 0.3 × 9 + 0.7 × 3 = ¥4.8/M,空闲为 ¥2.4/M,均为全量 Pro 的约 53%;但默认预算仍取峰时 ¥4.8。

  • 选 Flash:批量摘要、数据清洗打标、客服 FAQ、固定模板的内容生成——任务结构清楚、不需要深度推理的大批量场景
  • 选 Pro:多步推理、数学与代码难题、复杂 Agent 规划,以及出错代价高的场景(自动操作业务数据、合同要点提取)
  • 拿不准:先 Flash 跑评测,不达标的子任务再按请求路由到 Pro,通常比全量 Pro 省接近一半
模型输入(¥/百万 tokens)输出(¥/百万 tokens)缓存命中(¥/百万 tokens)上下文最大输出
DeepSeek V4 Flash3 峰时 / 1.5 空闲9 峰时 / 4.5 空闲0.10 峰时 / 0.05 空闲1M384K
DeepSeek V4 Pro9 峰时 / 4.5 空闲27 峰时 / 13.5 空闲0.30 峰时 / 0.15 空闲1M384K
DeepSeek V3.2(已下线)280.5128K8K

缓存也分时:默认按峰时 ¥0.10 / ¥0.30 预算

请求前缀与此前请求相同时,命中部分按缓存价计费。V4 Flash 峰时/空闲缓存为 ¥0.10/¥0.05,Pro 为 ¥0.30/¥0.15;四组均约为对应时段未命中输入价的 1/30。

假设每月 100M 输入 tokens、缓存命中率 70%。Flash 峰时成本 = 70 × 0.10 + 30 × 3 = ¥97,均价 ¥0.97/M;空闲成本 = 70 × 0.05 + 30 × 1.5 = ¥48.5,均价 ¥0.485/M。若完全不缓存,峰时/空闲分别为 ¥300/¥150。

Pro 同口径峰时为 70 × 0.30 + 30 × 9 = ¥291,均价 ¥2.91/M;空闲为 ¥145.5,均价 ¥1.455/M。比价应同时带入命中率和时段;缓存生效条件、写入计费与有效期以 DeepSeek 官方文档为准。

还在用 V3.2?迁移账和两个注意点

V3.2 标价输入 ¥2、输出 ¥8,上下文 128K、最大输出 8,192 tokens,其官方入口(deepseek-chat / deepseek-reasoner)已于 2026-07-24 下线,项目必须迁移;但迁移后的账单不一定下降。

以每月 10M 输入 + 5M 输出算:V3.2 为 ¥60。V4 Flash 峰时为 10 × 3 + 5 × 9 = ¥75,空闲为 ¥37.5;V4 Pro 峰时为 ¥225,空闲为 ¥112.5。迁移是接口与能力要求,不应继续用旧价承诺省 67%。

V4 Flash 峰时输出 ¥9 略高于 V3.2 的 ¥8,空闲 ¥4.5 更低;Pro 两个时段的输出都更高。缓存方面 V3.2 为 ¥0.5,Flash 峰时/空闲为 ¥0.10/¥0.05,分别低 5 倍/10 倍。迁移时要重做负载预算,并检查是否按旧 8,192 上限写死 max_tokens。

横向对比:统一按峰时默认、空闲作为可选情形

GPT-5.5 折合 ¥33.93/¥203.56。按 1M 输入 + 1M 输出算,GPT 为 ¥237.49;V4 Flash 峰时 ¥12、空闲 ¥6,分别约低 20 倍/40 倍;V4 Pro 峰时 ¥36、空闲 ¥18,分别约低 6.6 倍/13.2 倍。

Qwen3.5 Flash 首档 ¥0.2/¥2,在短请求下比 V4 Flash 的峰时和空闲价都低;DeepSeek 的差异是 1M 上下文、384K 最大输出与开源权重。Qwen 本身也有输入长度阶梯,长请求要按升档后的整单价格比较。

GLM-4.7 为 ¥2/¥8、缓存 ¥0.4。它比 V4 Flash 峰时 ¥3/¥9 更低,但高于 V4 Flash 空闲 ¥1.5/¥4.5;DeepSeek 缓存峰时/空闲 ¥0.10/¥0.05 更低。相对排序会随时段和命中率变化。

模型输入(¥/M)输出(¥/M)缓存命中(¥/M)上下文
DeepSeek V4 Flash3 峰时 / 1.5 空闲9 峰时 / 4.5 空闲0.10 峰时 / 0.05 空闲1M
DeepSeek V4 Pro9 峰时 / 4.5 空闲27 峰时 / 13.5 空闲0.30 峰时 / 0.15 空闲1M
GPT-5.5($5/$30)33.93203.563.39400K
Qwen3.5 Flash0.22131K
GLM-4.7280.4200K

什么场景别选 V4

最硬的一条限制:V4 系列是纯文本模型,不接受图片、音频输入。需要 OCR、截图或图表理解应看多模态模型,例如 Gemini 3.5 Flash 或按输入长度分档的 Doubao 1.6(首档 ¥0.8/¥8、最高档 ¥2.4/¥24)。

输入极轻、上下文短时,Qwen3.5 Flash 首档 ¥0.2 更合适。无缓存的一次性批量任务里,V4 Flash 峰时 ¥3/¥9、空闲 ¥1.5/¥4.5,应与混元 TurboS(¥0.8/¥2)等模型按同一负载比较;不能把空闲价当全天价,也不能假定缓存一定命中。

一句话版决策树:要多模态,不选 V4;输入轻、上下文短,看 Qwen3.5 Flash;大批量模板化任务,V4 Flash;复杂推理和 Agent 主力,V4 Pro;还在 V3.2 上的,现在就迁。

常见问题

DeepSeek V4 API 多少钱一百万 tokens?

V4 Flash 峰时输入/输出/缓存为 ¥3/¥9/¥0.10,空闲为 ¥1.5/¥4.5/¥0.05;V4 Pro 峰时为 ¥9/¥27/¥0.30,空闲为 ¥4.5/¥13.5/¥0.15。两档均为 1M 上下文、384K 最大输出;默认预算取峰时。

V4 Flash 和 V4 Pro 有什么区别,怎么选?

两档规格完全相同,差的是模型能力和三倍的价格。批量、模板化、结构清楚的任务用 Flash;多步推理、复杂 Agent、出错代价高的任务用 Pro。拿不准就先用 Flash 跑评测集,不达标的子任务再单独路由到 Pro。

DeepSeek 的缓存命中是怎么省钱的?

请求前缀命中时按缓存价计费。V4 Flash 峰时缓存 ¥0.10、未命中 ¥3;70% 命中时有效输入均价为 0.7 × 0.10 + 0.3 × 3 = ¥0.97/M。空闲同口径为 ¥0.485/M。预算默认用峰时,具体生效与写入规则以官方文档为准。

V3.2 还能继续用吗?要不要迁移?

V3.2 对应的 deepseek-chat / deepseek-reasoner 已于 2026-07-24 下线,必须迁移。但新分时价下账单不保证下降:V4 Flash 峰时 ¥3/¥9、空闲 ¥1.5/¥4.5,V4 Pro 峰时 ¥9/¥27、空闲 ¥4.5/¥13.5。迁移前重算负载,并检查是否写死旧 8,192 输出上限。

DeepSeek V4 支持图片输入吗?

不支持。V4 系列是纯文本模型,需要图片或多模态理解的业务可以看 Gemini 3.5 Flash、Doubao 1.6 等多模态模型。

文中价格与价格表同源、每日核对。选型前去看一眼最新价。

打开价格表 →