深度文章
大模型 API 的计费机制、省钱实战和选型方法论。文中价格全部来自厂商官方定价页, 与价格表同源、可溯源。
计费入门
计费入门2026-06-10 · 约 9 分钟
大模型 API 到底怎么计费?token、输入输出、缓存、Batch 一文说清
写给第一次对接 LLM API 的开发者:输入价和输出价为什么分开收、token 怎么数、缓存命中价为何便宜一个数量级、Batch 批处理怎么省钱。用 Qwen3.5 Flash 和 GPT-5.5 算同一笔账,差距约 113 倍。
计费入门2026-07-22 · 约 3 分钟
读懂大模型价目表的 5 个术语陷阱:这些坑我替你踩过
百万 token、缓存输入价、Batch、上下文窗口、原始计费货币——大模型价目表上这几个术语,每一个都藏着能让你估错账单的坑。用算盘上的真实数字,把它们逐个讲清楚。
计费入门2026-07-31 · 约 5 分钟
倍率、充值比例、分组倍率:把中转站报价换算成实付单价
中转站用「模型倍率 0.15、分组倍率 2、充值比 1:1」报价,官方用「每百万 tokens 多少美元」报价,两套体系没法直接比。这篇给出换算公式和一个自查方法,并说明为什么低于官方价 15% 是需要警惕的信号。不点名任何站点,只讲怎么算。
省钱实战
省钱实战2026-06-10 · 约 10 分钟
上下文缓存(Prompt Caching)实战:哪些场景真能省 90%
用真实价格数据拆解 LLM 上下文缓存:DeepSeek V4 Flash 峰时/空闲缓存价均约为对应输入价的 1/30,GPT-5.5 与 Claude 约 10%。讲清哪些 workload 吃得到缓存、前缀怎么排、写入加价和时效的坑,并用客服机器人算例对比月成本。
省钱实战2026-06-10 · 约 11 分钟
Agent 应用为什么烧钱?5 个成本大头与对策
Agent 应用的账单为什么比单轮对话贵一个数量级?拆解上下文滚雪球、工具结果回灌、推理 token、失败重试、长系统提示词五个成本大头,用 50 步任务算例对比三款模型总价,逐项给出省钱对策。
省钱实战2026-07-22 · 约 4 分钟
AI 客服账单怎么降:缓存、路由、输出与 Batch 四步拆解
用当前模型单价拆解中型 AI 客服的 token 账单,说明缓存、分级路由、压缩输出与 Batch 分别影响哪一项;分时模型默认按峰时预算,不承诺失效的固定降本数字。
省钱实战2026-08-02 · 约 2 分钟
Agent 的账单为什么涨得比感觉快
Agent 每一轮都要把历史重新喂一遍,输入随轮数线性增长、总账单按平方量级走。这篇讲清 Prompt Cache 的前缀匹配条件、TTL 过期后 1.25 倍写入溢价,以及爆窗截断为什么会把缓存一起打断。
避坑
避坑2026-06-13 · 约 5 分钟
别信「永久免费」清单——6 家国产免费大模型 API 的评论区真相
智谱/混元/千帆/讯飞/硅基/火山的「永久免费」到底有几分真?我们扒了 V2EX、知乎、linux.do 的真实用户反馈和免费政策变动史:永久免费多是营销话术、真免费的只有小模型、新人额度全是限时、限速真实触发 429。看文案不如看评论。
避坑2026-06-12 · 约 4 分钟
AI 订阅限额大变局:Copilot 改按量、Claude 拆积分池,订阅党生存指南
2026 年 6 月,AI 订阅的游戏规则集中生变:GitHub Copilot 改按 token 计量、Claude 订阅 6 月 15 日起拆分积分池(不滚存)、ChatGPT 免费档投广告、豆包官宣 68/200/500 元三档。这篇把每家的变化、背后的成本逻辑和订阅用户的应对策略一次讲清。
避坑2026-06-10 · 约 11 分钟
1M 长上下文的价格真相:用满一次到底花多少钱
标称 1M、2M 的长上下文不是免费容量:Claude Opus 4.8 用满一次输入就要 ¥33.93,多轮对话还会平方级滚雪球。本文用算式拆解用满成本、整本塞与 RAG 的对照账,以及缓存能救到什么程度。
避坑2026-06-10 · 约 10 分钟
为什么账单总比估算贵?大模型计费的 6 个隐藏开销
账单比估算贵,多半不是厂商乱扣费:中文 token 折算、思考 token、多轮历史重发、工具调用、重试计费、max_tokens 失控,六个隐藏开销逐条给排查与止血动作,附可复算的算例和上线前估算工作流。
避坑2026-07-31 · 约 8 分钟
土耳其早就不便宜了:8 个地区 AI 订阅价格实测
抓了 ChatGPT、Claude、Gemini、Grok、Perplexity 在 8 个地区 App Store 的一手内购价。结论和流传的说法不一样:土耳其的 ChatGPT Plus 比美国还贵 5%,但同一个土耳其的 Gemini 便宜 43%;日本反而普遍便宜;折扣最大的其实是官方给新兴市场的低价档,不用改区。
避坑2026-07-31 · 约 6 分钟
长上下文的价格陷阱:多喂一个 token,整单价格翻倍
9 个主流模型的输入超过阈值后单价会跳档,而且是整单重算而非超出部分才涨。Qwen3.5 Flash 从 ¥0.2 跳到 ¥1.2 是 6 倍,海外几家统一翻倍。我们自己的计算器也踩过这个坑,连带 K 到底是 1000 还是 1024 也搞错过,两个坑都在本文里拆开讲。
避坑2026-07-31 · 约 6 分钟
限流才是看不见的那半张账单
标称便宜但抢不到、买了套餐几轮就打满,这些都不进价目表却真实决定成本。各家限流的计量单位根本不统一:OpenAI 和 Gemini 讲 RPM/TPM/RPD,DeepSeek 讲并发数,订阅制只给相对倍数。这篇讲清楚怎么看懂它们,以及一个被广泛误解的事实:限流按账户算,多开 API key 没用。
选型
选型2026-06-10 · 约 13 分钟
8 个真实场景的大模型选型:别只盯单价
单看「百万 token 多少钱」选模型容易选错:输入输出比例才决定真实成本。本文按输入密集、输出密集拆解客服、代码、RAG、Agent 等 8 个场景,各给省钱、均衡、旗舰三档推荐,所有算式可复核。
选型2026-06-10 · 约 8 分钟
DeepSeek V4 API 成本完全指南:Flash 和 Pro 怎么选
DeepSeek V4 Flash(峰时 ¥3/¥9、空闲 ¥1.5/¥4.5)和 V4 Pro(峰时 ¥9/¥27、空闲 ¥4.5/¥13.5)怎么选?本文按北京时间分时口径拆解缓存、迁移与横向成本。
选型2026-07-22 · 约 5 分钟
横评全站 44 款大模型 API 价格后,6 个反直觉的结论
把算盘收录的 44 款主流大模型 API 价格拉成一张表,逐列比对输入价、输出价、缓存价与上下文窗口后,浮现出 6 个和直觉相反的结论——它们比单纯的「谁最便宜」更能决定你的账单。
选型2026-07-22 · 约 3 分钟
2026 上半年大模型 API 价格复盘:谁在降、降了多少、你该怎么接
回看半年来的价格变动:Anthropic 曾下调 Opus,DeepSeek 曾把 V4 Pro 限时折扣转永久,随后又改为分时价。历史事件用于说明成本模型必须持续复核,不代表当前报价。
选型2026-07-29 · 约 7 分钟
2026 年 7 月大模型 API 价格复盘:官方价没动,渠道价在退潮
7 月主流厂商挂牌价零调整,变化全在渠道层:DeepSeek 旧模型名 7-24 下线、硅基流动 V4 Pro 促销到期恢复 4 倍原价、百炼 Qwen3.7 Max 的 5 折没有截止日。逐条核实过程与应对建议。
选型2026-08-02 · 约 3 分钟
买显卡自建,到底多大用量才回本
硬件成本除以折旧月数、再和云端每百万 token 单价对比,这套算法漏了最硬的一项:机器本身能不能产出那么多 token。含可复现算例与常见的双重计费错误。