长上下文的价格陷阱:多喂一个 token,整单价格翻倍
很多人算长文本任务的成本时,是拿价目表首页那个单价乘以 token 数。这个算法在输入不长时没问题,一旦超过某个阈值就会系统性算少——因为 9 个主流模型的输入单价是分档的,超过阈值后单价直接翻倍甚至翻 6 倍。
更容易被忽略的是计费方式:不是超出部分才按高价,而是整个请求的所有 token 都按新档重算。阿里云百炼的计费规则页写得很直白:「单价取决于单次请求的输入 Token 总量。该请求的所有 Token 均按对应阶梯的单价结算。」多喂进去一个 token,整单价格就跳一级。
谁在分档,跳几倍
下面是我们价格库里已建模分档的 9 个模型。海外四家统一是超过阈值翻倍,国产三家的档位更密、跳得更陡。
| 模型 | 第一档 | 第二档 | 第三档 | 输入价最大跳幅 |
|---|---|---|---|---|
| GPT-5.5 | ≤272K:$5 / $30 | >272K:$10 / $45 | — | 2 倍 |
| GPT-5.4 | ≤272K:$2.5 / $15 | >272K:$5 / $22.5 | — | 2 倍 |
| Claude Sonnet 4.6 | ≤200K:$3 / $15 | >200K:$6 / $22.5 | — | 2 倍 |
| Gemini 3.1 Pro | ≤200K:$2 / $12 | >200K:$4 / $18 | — | 2 倍 |
| Gemini 2.5 Pro | ≤200K:$1.25 / $10 | >200K:$2.5 / $15 | — | 2 倍 |
| Grok 4.3 | ≤200K:$1.25 / $2.5 | >200K:$2.5 / $5 | — | 2 倍 |
| Qwen3 Max | ≤32K:¥2.5 / ¥10 | ≤128K:¥4 / ¥16 | >128K:¥7 / ¥28 | 2.8 倍 |
| Qwen3.5 Plus | ≤128K:¥0.8 / ¥4.8 | ≤256K:¥2 / ¥12 | >256K:¥4 / ¥24 | 5 倍 |
| Qwen3.5 Flash | ≤128K:¥0.2 / ¥2 | ≤256K:¥0.8 / ¥8 | >256K:¥1.2 / ¥12 | 6 倍 |
整单重算,所以差价比你以为的大得多
假设你做一个文档问答系统,每次请求塞 250K 上下文,用 Qwen3.5 Flash,每天 1000 次。
按价目表首页的 ¥0.2 算:250K × 1000 次 × 30 天 = 7.5B tokens,月成本约 1500 元。实际上 250K 落在第二档,单价是 ¥0.8,月成本 6000 元。差 4500 元,而且不是因为你多用了,是因为算错了档。
如果这个系统的上下文再涨一点到 260K,就掉进第三档 ¥1.2,月成本 9000 元。从 250K 到 260K,上下文只多了 4%,账单涨了 50%。
这就是分档计费和线性计费最大的区别:成本曲线是阶梯状的,在阈值附近极度敏感。
我们自己也踩了这个坑,而且踩了两次
说这个话题有底气,是因为本站的三个计算器在 2026-07-31 之前一直算错。models.json 里每个模型只存了一个扁平单价,分档结构根本没建模,所以 Token 计算器、月账单计算器、省钱路由在长输入场景下全部系统性低估。
修的时候又踩了第二个坑。给阿里云那三个模型录档位阈值时,我按程序员的习惯把 128K 写成了 128×1024=131072。但百炼计费规则页写得很清楚:「计费区间中的 K 表示 1,000」,128K 就是 128,000。差出来的 3072 token 区间里,请求会被算成低一档的价格。
两个坑的性质不同:第一个是漏了一整个维度,第二个是单位默认值想当然。第二个更隐蔽——数字看着对,逻辑也对,只有去读厂商的计费规则原文才会发现 K 的定义和你以为的不一样。
有意思的是,竞品也没做这件事
OpenRouter 的模型目录里带了 49 个模型的跳档数据字段,但它自己的模型页只展示扁平单价,没有做跳档的展示层。我们查了一圈,主流比价站里没有把分档价格接进成本计算的。
原因大概是这个字段拿到容易、用起来麻烦:要改数据结构、要改计算逻辑、要在界面上表达清楚「你这个输入长度落在哪档」。但对做长文本的人来说,不做这件事的价格表就是不准的。
几条实操建议
如果你的任务涉及长上下文,下面几件事值得做一遍。
- 先量一下自己请求的输入 token 分布,看有多少比例落在阈值以上。卡在阈值附近的话,把上下文压到阈值以内,单价直接减半。
- 算成本时用能识别分档的工具。本站的 Token 计算器和月账单计算器现在会按你填的输入长度自动取档,模型页也有完整分档表。
- 别把「上下文窗口 1M」当成可以随便用满。Qwen3.5 Flash 支持 1M 上下文,但用到 300K 时单价已经是 128K 以内的 6 倍。窗口大小和价格档位是两件事。
- 读厂商计费规则时留意单位定义。K 是 1000 还是 1024、tokens 怎么算、缓存命中怎么计价,这些细节决定了你的估算差多少。
数据来源
阿里云三个模型的档位取自百炼模型价格页直读;OpenAI、Anthropic、Google、xAI 四家的档位经 LiteLLM 公开价格数据集核对,均标注在各模型详情页的分档表下方。核对日期 2026-07-31。
还没建模分档的模型(如 Claude Opus 系列、GLM、Kimi、豆包)在数据里没有 tiers 字段,我们不猜——查不到官方分档说明就不写,宁可留白。
常见问题
超过阈值后,是全部 token 涨价还是只有超出部分涨价?
全部。百炼计费规则页原文:「单价取决于单次请求的输入 Token 总量。该请求的所有 Token 均按对应阶梯的单价结算。」所以输入 128,001 token 和 128,000 token 的单价完全不同,前者整单按高档算。
128K 到底是 128,000 还是 131,072?
阿里云百炼明确写的是 128,000(K 表示 1,000)。这一点我们最初也搞错过,按 1024 进制录成了 131,072,后来读官方计费规则才修正。不同厂商的定义未必一致,看具体文档为准。
哪些模型没有分档?
DeepSeek V4 系列、GLM、Kimi、豆包等我们没查到官方分档说明的,价格库里就没有 tiers 字段,按单一价计算。找不到依据的我们不填,避免编造。
缓存命中价也会跟着跳档吗?
海外几家会。以 GPT-5.5 为例,272K 以内缓存价 $0.5,超过后 $1;Sonnet 4.6 从 $0.3 到 $0.6,同样翻倍。阿里云那三个模型的分档表里没有单列缓存价,缓存按另一套规则计费。
怎么知道我的请求落在哪一档?
看单次请求的输入 token 总量,不是上下文窗口大小,也不是累计用量。本站模型详情页有完整分档表,Token 计算器会按你粘贴的文本自动判断落在哪档并用该档单价计算。
文中价格与价格表同源、每日核对。选型前去看一眼最新价。
打开价格表 →