跳到主内容
算盘
省钱实战2026-09-28 发布 · 约 4 分钟读完

Fable 5.1 挂牌价是 Opus 5 的两倍,缓存读够多时每轮反而更便宜

Claude Fable 5.1 在 2026-09-01 发布,标准输入输出价和 Fable 5 一样是 $10/$50 每百万 token,唯一变的是缓存命中价:从 $1 降到 $0.25,降了 75%。

价目表上它仍然是 Opus 5($5/$25,缓存命中 $0.5)的两倍。可缓存命中这一栏,Fable 5.1 反而只有 Opus 5 的一半。所以谁更便宜,取决于你每一轮里有多少 token 是走缓存读的。下面用本站价格表把这笔账算到具体的交叉点。

单轮成本只有三项,缓存读是唯一被改的那项

一次调用的账单可以拆成三块:缓存读取的 token × 缓存命中价、没命中的新输入 × 输入价、输出 × 输出价。Fable 5.1 相对 Fable 5 只动了第一块,所以省多少完全看第一块在账单里占多大。

我们设了两个典型场景。长上下文 Agent:每轮带 10 万 token 已缓存的上下文,新输入 2000,输出 1000。普通对话:缓存 5000,新输入 1000,输出 800。

场景(每轮)Fable 5Fable 5.1Opus 5
Agent:缓存 10 万 / 新输入 2K / 输出 1K$0.170$0.095$0.085
对话:缓存 5K / 新输入 1K / 输出 800$0.055$0.051$0.028

Agent 场景省 44%,对话场景只省 7%

长上下文 Agent 里,缓存读占了 Fable 5 单轮账单的六成,砍 75% 之后单轮从 $0.170 降到 $0.095,省 44%,和发布报道里「重度 Agent 场景约省 45%」对得上。

对话场景的缓存只有几千 token,账单大头是输出,降价几乎没感觉,单轮只少了不到半美分。这时 Opus 5 仍然便宜将近一半,换 Fable 5.1 纯属多花钱。

交叉点:缓存读 = 20 × 新输入 + 100 × 输出

把两家的单价代进去:Fable 5.1 每轮比 Opus 5 多付的是新输入和输出那两块(单价各高一倍),少付的是缓存读那块(单价低一半)。两边相等时,缓存读取量 R 满足 0.25R = 5U + 25O,也就是 R = 20U + 100O。

按新输入 2000、输出 1000 算,交叉点是 14 万缓存 token。低于它 Opus 5 便宜;高于它 Fable 5.1 便宜。缓存 20 万时 Fable 5.1 每轮便宜约 11%,40 万时便宜约 28%。输出越长交叉点越远,每多 1000 输出 token,要多 10 万缓存 token 才能追平。

  • 缓存 14 万:两者每轮都是 $0.105
  • 缓存 20 万:Fable 5.1 $0.120,Opus 5 $0.135
  • 缓存 40 万:Fable 5.1 $0.170,Opus 5 $0.235

别忘了缓存写入,它会把回本点推后几十轮

上面只算了缓存读。第一次把 20 万 token 的上下文写进缓存要另付写入费。Anthropic 对 Opus 5 的规则是 5 分钟缓存写入按输入价 1.25 倍计费;本站价格表没有单列 Fable 5.1 的写入价,如果它同样按 1.25 倍走,每次写 20 万 token 的前缀,Fable 5.1 要比 Opus 5 多付 $1.25。

而 20 万缓存下每轮只便宜 $0.015,要连续跑 80 多轮才把这笔写入差价赚回来。缓存 5 分钟过期、上下文被频繁重写的工作流,交叉点实际上达不到。我们第一版算账就漏了这一项,结论差点写反。

怎么判断你该换哪个

先从账单或日志里拿三个数:每轮平均缓存读取、新输入、输出,再看同一前缀平均连续复用多少轮。

  • 缓存读低于 20 × 新输入 + 100 × 输出:留在 Opus 5
  • 高于交叉点、但前缀复用不到几十轮:写入费吃掉差价,仍然留在 Opus 5
  • 高于交叉点且同一前缀长时间复用(长会话代码 Agent、固定大文档问答):Fable 5.1 单轮更便宜,还多拿 3 分智能指数(66 对 63)
  • 从 Fable 5 升级:直接换,价格只降不涨

常见问题

Fable 5.1 比 Fable 5 贵吗?

不贵。标准输入输出价都是 $10/$50 每百万 token,只有缓存命中价从 $1 降到 $0.25,任何工作负载都不会变贵。

为什么挂牌价贵一倍的模型会更便宜?

因为 Fable 5.1 的缓存命中价 $0.25 只有 Opus 5($0.5)的一半。当每轮大部分 token 都是缓存读取时,这一项的差距会盖过输入输出单价的差距。

交叉点公式怎么用?

缓存读取量 R = 20 × 新输入 + 100 × 输出。你的每轮缓存读取超过这个值,Fable 5.1 单轮更便宜;此外还要把缓存写入的一次性差价按复用轮数摊进去。

文中价格与价格表同源、每日核对。选型前去看一眼最新价。

打开价格表 →