横评全站 44 款大模型 API 价格后,6 个反直觉的结论
大部分人挑模型,眼睛只盯着那个「输入价」的数字:谁每百万 token 便宜,就用谁。这是最容易踩坑的看法。
我们把算盘当前收录的 44 款主流大模型 API 的完整价目——输入价、输出价、缓存输入价、上下文窗口——拉成一张表,一列一列地横着比。比完之后,有 6 个结论和「盯着输入价」的直觉是反的。它们不是玄学,是从真实价目里直接读出来的,而每一个都可能让你的月账单差出好几倍。
1. 决定账单的往往是输出价,不是输入价
输入价好看、输出价吓人,是这一代模型最普遍的定价结构。以 GPT-5.1 为例,输入 ¥1.25/百万 token,输出却是 ¥10,是输入的 8 倍。Gemini 2.5 Pro 同样是 ¥1.25 进、¥10 出。百川 M2 更极端,¥2 进、¥20 出,整整 10 倍。
这意味着:如果你的任务是「喂进一大段文档、只要一句结论」(摘要、分类、抽取),输入占大头,这些模型很划算;但如果是「短问题、长回答」(写作、代码生成、Agent 多轮推理),输出占大头,同一个模型的实际成本会翻好几倍。只看输入价排序,等于用错了标尺。
| 模型 | 输入价(¥/M) | 输出价(¥/M) | 输出/输入倍数 |
|---|---|---|---|
| GPT-5.1 | 1.25 | 10.0 | 8× |
| Gemini 2.5 Pro | 1.25 | 10.0 | 8× |
| 百川 M2 | 2.0 | 20.0 | 10× |
| DeepSeek V4 Flash | 1.0 | 2.0 | 2× |
| Grok 4.3 | 1.25 | 2.5 | 2× |
2. 缓存价的折扣幅度,比模型之间的价差更悬殊
上下文缓存(Prompt Caching)把重复前缀的价格打骨折,但各家折扣天差地别。DeepSeek V4 Pro 输入 ¥3、缓存命中只要 ¥0.025,便宜 120 倍。Claude 系列缓存 ¥0.5、输入 ¥5,是 10 倍。而不少国产模型(Qwen3.5 Plus、混元 TurboS、文心 X1 Turbo)干脆不提供缓存价。
对带长 System Prompt、长 few-shot、或反复读同一批文档的应用(客服、RAG、Agent),缓存命中率决定一切。一个缓存 120 倍便宜的模型,在缓存密集场景里的真实成本,可能比一个「输入价更低但没有缓存」的模型还低一个数量级。选型时如果不问缓存价,等于把最大的一张省钱牌扔了。
3. 「最便宜」和「最贵」之间,差的是 100 倍不是 2 倍
全站输入价最低的是 Gemini 2.5 Flash-Lite,¥0.1/百万 token;最高的是 Qwen3.7 Max ¥12 和 Claude Fable 5 ¥10(输出更是 ¥50)。首尾之间输入价差 100 倍以上,输出价差百倍量级。
这条价差光谱意味着「用一个模型打天下」几乎总是亏的。真正省钱的架构是分级路由:简单任务(意图识别、格式化、短答)交给 Flash-Lite 档,把 99% 的调用量压在 ¥0.1–0.3 区间;只有真正需要复杂推理的那 1%,才升级到 ¥5–10 的旗舰。多数账单爆炸,不是因为用了贵模型,而是因为把贵模型用在了本该用便宜模型的地方。
4. 国产旗舰和海外旗舰的价差,没有能力差那么大
国产旗舰这一档:DeepSeek V4 Pro ¥3/¥6、GLM-5 ¥4/¥18、Kimi K2.6 ¥6.5/¥27。海外旗舰:Claude Opus 4.8 ¥5/¥25、GPT-5.5 ¥5/¥30、Claude Fable 5 ¥10/¥50。
输入价上国产旗舰普遍是海外的一半到三分之一,输出价差距更明显。但在很多中文任务、结构化输出、代码补全场景,两档的实际效果并没有拉开到「价格差几倍」那种程度。这不代表国产一定够用。稳妥的做法是先用便宜档跑通你的真实评测集,只有当它在你的具体指标上明确不达标时,再为海外旗舰的溢价买单,而不是反过来,默认用最贵的再想着怎么省。
5. 同价位里,输出价能差一倍
把输入价卡在 ¥2 这一档看:DeepSeek V3.2 是 ¥2/¥8,GLM-4.7 ¥2/¥8,而豆包 1.6 是 ¥2.4/¥24、百川 M2 ¥2/¥20。输入价几乎一样,输出价却能差两三倍。
如果只按输入价把这些模型归成「同一档」然后随便挑,输出重的应用就会莫名其妙地贵。同价位选型的正确做法是:锁定你任务的输入输出比,再在这一档里挑输出价最优的那个。
6. 「限时优惠转永久」正在成为国产厂商的常规打法
价格不是刻在石头上的。近半年算盘追踪到的价格变动里,最典型的一次是 DeepSeek 把 V4 Pro 原定 5 月底结束的「2.5 折限时优惠」直接转成永久,输入价从 ¥12 一路落到 ¥3。海外这边,Anthropic 也罕见地把 Opus 4.7 的输入输出各砍约 67%,从 $15/$75 降到 $5/$25。
这带来一个实际操作建议:不要把三个月前记下的价格当常量写进你的成本模型。国产厂商的「限时→永久」和海外的阶段性大降价,会让你的最优选型每隔一两个月就变一次。定期用一个每日核价的工具复核,比一次性算好账单更省钱。
常见问题
那到底该先看输入价还是输出价?
先估算你任务的输入输出比。文档摘要、分类、抽取这类「进多出少」的看输入价;写作、代码、Agent 这类「进少出多」的以输出价为准。把两者按你的真实比例加权,才是有意义的比较。
缓存价对我有没有用,怎么判断?
看你每次请求里是否有大段重复不变的前缀(固定 System Prompt、固定 few-shot、反复引用的同一批文档)。有,且命中率高,缓存价就是省钱主力;没有,缓存价再低也用不上。
国产便宜档能不能直接替代海外旗舰?
没有普适答案,取决于你的具体任务。正确流程是先用便宜档在你自己的评测集上跑分,只有当它在你关心的指标上明确不达标时,再升级。用真实评测代替「贵的一定更好」的默认假设。
文中价格与价格表同源、每日核对。选型前去看一眼最新价。
打开价格表 →