跳到主内容
算盘

大模型 Prompt Caching 缓存价格对比与选型指南

💡 缓存降本核心结论

按当前已核数据,提示词缓存(Prompt Caching)的最大输入价差为 50.0 倍(节省 98.00%),对应 MiMo-V2.5。表中折扣均由同一模型、同一计费时段的普通输入价与缓存命中价现算;分时模型默认采用峰时保守价,不再引用旧缓存价或把空闲价当作全天价。实际总账单还取决于首次写入、缓存有效期与真实命中率。

主流模型 缓存 vs 非缓存 输入价格对比表

模型厂商原输入单价缓存输入单价节省比例价差倍数计费币种核对时间来源
MiMo-V2.5🇨🇳 小米 MiMo¥1.00¥0.020098.00%50.0xCNY (¥1.00)2026-07-31官方定价
DeepSeek V4 Flash🇨🇳 DeepSeek¥3.00峰时默认¥0.1000峰时默认96.67%30.0xCNY (¥3.00)2026-08-21官方定价
DeepSeek V4 Pro🇨🇳 DeepSeek¥9.00峰时默认¥0.3000峰时默认96.67%30.0xCNY (¥9.00)2026-08-21官方定价
GPT-5.6 Luna🇺🇸 OpenAI¥1.35¥0.134790.00%10.0xUSD ($0.20)2026-08-01官方定价
Gemini 3.1 Flash-Lite🇺🇸 Google¥1.68¥0.168490.00%10.0xUSD ($0.25)2026-08-01官方定价
Gemini 2.5 Flash🇺🇸 Google¥2.02¥0.202190.00%10.0xUSD ($0.30)2026-08-01官方定价
GPT-5.1🇺🇸 OpenAI¥8.42¥0.842190.00%10.0xUSD ($1.25)2026-08-01官方定价
Gemini 2.5 Pro🇺🇸 Google¥8.42¥0.842190.00%10.0xUSD ($1.25)2026-08-01官方定价
Claude Haiku 4.5🇺🇸 Anthropic¥6.74¥0.673790.00%10.0xUSD ($1.00)2026-08-01官方定价
GPT-5.6 Terra🇺🇸 OpenAI¥13.47¥1.347490.00%10.0xUSD ($2.00)2026-08-01官方定价
Claude Sonnet 5🇺🇸 Anthropic¥13.47¥1.347490.00%10.0xUSD ($2.00)2026-08-01官方定价
Gemini 3.1 Pro Preview🇺🇸 Google¥13.47¥1.347490.00%10.0xUSD ($2.00)2026-08-01官方定价
Kimi K3🇨🇳 Moonshot / Kimi¥20.00¥2.000090.00%10.0xCNY (¥20.00)2026-08-26官方定价
Claude Sonnet 4.6🇺🇸 Anthropic¥20.21¥2.021190.00%10.0xUSD ($3.00)2026-08-01官方定价
GPT-5.5🇺🇸 OpenAI¥33.69¥3.368590.00%10.0xUSD ($5.00)2026-08-01官方定价
GPT-5.6 Sol🇺🇸 OpenAI¥33.69¥3.368590.00%10.0xUSD ($5.00)2026-08-01官方定价
Claude Opus 4.8🇺🇸 Anthropic¥33.69¥3.368590.00%10.0xUSD ($5.00)2026-08-01官方定价
Claude Opus 5🇺🇸 Anthropic¥33.69¥3.368590.00%10.0xUSD ($5.00)2026-08-01官方定价
Claude Opus 4.7🇺🇸 Anthropic¥33.69¥3.368590.00%10.0xUSD ($5.00)2026-08-01官方定价
Claude Fable 5🇺🇸 Anthropic¥67.37¥6.737090.00%10.0xUSD ($10.00)2026-08-01官方定价
GPT-5.4🇺🇸 OpenAI¥16.84¥1.684390.00%10.0xUSD ($2.50)2026-08-01官方定价
Gemini 3.6 Flash🇺🇸 Google¥10.11¥1.010690.00%10.0xUSD ($1.50)2026-08-01官方定价
Gemini 3.5 Flash🇺🇸 Google¥10.11¥1.010690.00%10.0xUSD ($1.50)2026-08-01官方定价
Gemini 2.5 Flash-Lite🇺🇸 Google¥0.67¥0.067490.00%10.0xUSD ($0.10)2026-08-01官方定价
Grok 4.3🇺🇸 xAI¥8.42¥1.347484.00%6.3xUSD ($1.25)2026-08-01官方定价
Kimi K2.6🇨🇳 Moonshot / Kimi¥6.50¥1.100083.08%5.9xCNY (¥6.50)2026-08-26官方定价
Doubao 1.6🇨🇳 字节豆包¥0.80¥0.160080.00%5.0xCNY (¥0.80)2026-07-03官方定价
Doubao 1.5 Pro🇨🇳 字节豆包¥0.80¥0.160080.00%5.0xCNY (¥0.80)2026-07-03官方定价
GLM-4.7🇨🇳 智谱 AI¥2.00¥0.400080.00%5.0xCNY (¥2.00)2026-08-26官方定价
MiniMax M3🇨🇳 MiniMax¥2.10¥0.420080.00%5.0xCNY (¥2.10)2026-08-26官方定价
MiniMax M2.7🇨🇳 MiniMax¥2.10¥0.420080.00%5.0xCNY (¥2.10)2026-08-26官方定价
Doubao Seed 2.1 Pro🇨🇳 字节豆包¥6.00¥1.200080.00%5.0xCNY (¥6.00)2026-07-03官方定价
Grok Build 0.1🇺🇸 xAI¥6.74¥1.347480.00%5.0xUSD ($1.00)2026-08-01官方定价
GLM-5.1🇨🇳 智谱 AI¥6.00¥1.300078.33%4.6xCNY (¥6.00)2026-08-26官方定价
文心 ERNIE 4.5 Turbo🇨🇳 百度文心¥0.80¥0.200075.00%4.0xCNY (¥0.80)2026-06-05官方定价
混元 Hy3🇨🇳 腾讯混元¥1.00¥0.250075.00%4.0xCNY (¥1.00)2026-06-05官方定价
DeepSeek V3.2🇨🇳 DeepSeek¥2.00¥0.500075.00%4.0xCNY (¥2.00)2026-08-21官方定价
GLM-5🇨🇳 智谱 AI¥4.00¥1.000075.00%4.0xCNY (¥4.00)2026-08-26官方定价

* 价格单位为人民币 ¥ / 百万 (Million) tokens。美元计费厂商按官方原价乘以汇率换算;分时模型按峰时保守价比较。绿色背景表示当前降幅最显著的模型。

🤔 什么是 Prompt Caching?它是如何工作的?

Prompt Caching(提示词缓存)是一项允许 API 厂商在云端节点上缓存您输入中重复使用部分的机制。当您连续发送包含相同前缀的请求(如相同的 System Prompt、相同的参考文档、或多轮对话中的历史记录)时,模型无需对已被缓存的部分重新进行计算,从而大大降低了计算开销和延迟。

通常,大模型计费中,输入 Token 的计算成本是主要的开销源。通过启用缓存,厂商可以以极低的价格计费(称为缓存输入价),从而给开发者带来巨大的降本空间。

💡 典型省钱场景推荐

  • 多轮长对话 (Long Chat):在客服机器人、AI 伴侣等场景中,每一轮对话都需要携带之前所有的历史消息。如果开启缓存,历史消息首次写入后,后续命中部分可按厂商公布的缓存价计费。
  • 长文档 / 知识库分析 (RAG):当您让 AI 针对一本几十万字的书籍或几百页的代码库反复提问时,如果将整本书/代码库放在 Prompt 的最前部,每次提问只需要支付新问题的 Token 原价,背景文档全部命中缓存,成本骤降。
  • 复杂 Agent 系统:智能体系统往往需要携带非常冗长、包含数百个 Step / Tools 定义的 System Prompt。对于这种“大系统提示词”,提示词缓存几乎能提供 90% 恒定的折扣。

❓ FAQ 常见问题解答

Q: 为什么不同厂商的缓存折扣差异很大?

A: 厂商分别制定命中价、写入价、生效门槛和有效期。公开价格只能证明折扣大小,不能证明未公开的底层成本。应使用同一计费时段的两项官方价格,并把实际命中率纳入预算。

Q: 缓存是自动生效的吗?还是需要在 API 中传特殊参数?

OpenAI (GPT-4o/GPT-5等) 属于自动生效,不需要任何代码修改,系统检测到前缀匹配(超过 1024 tokens)就会自动应用折扣。

Anthropic Claude 需要在 API 请求的 messagessystem 节点中手动指定 "cache_control": {"type": "ephemeral"} 属性才可生效,否则仍按原价计费。

DeepSeek 也是自动生效,只要有超过 1024 tokens 的公共前缀匹配即可享受折扣。

Q: 缓存有有效期吗?

A: 有的。缓存通常属于短期临时缓存(Ephemeral Cache)。对于 Anthropic Claude,缓存的生命周期通常为 5 分钟;DeepSeek 也是几分钟级别。如果在此时间内没有新的请求命中该缓存,缓存就会被自动清理。因此,只有在较为频繁的对话或调用中,缓存才能发挥最大价值。

想评估您的具体 Prompts 跑在各模型上的真实缓存开销?使用我们的 Token 估算器即可自动计算。

去 Token 估算器计算缓存开销 →