Agent 多轮成本演化计算器
逐轮模拟 Agent 交互中历史对话与工具返回结果回喂带来的 Token 膨胀,算清 Prompt Cache 开启与 TTL 过期下的真实账单。单次输入求和?用 Token 估算器;对比本地算力与云 API 回本周期?用 本地 vs 云 API 回本计算器。
计算参数设置
模拟多轮 Agent 交互中历史 Context 累积及 Prompt Cache 对成本的影响
GPT-5.5
20 轮总成本 (无缓存: $1.6500)
Claude Sonnet 4.6
20 轮总成本 (无缓存: $0.9420)
累计成本演化曲线 (1~20 轮)
对比不同模型随轮数增加的成本积累走势 (纯 SVG 渲染)
逐轮交互成本明细
| 轮数 (k) | 上下文 S_in | 缓存命中 / 新增 | 单轮成本 | 累计成本 | 无缓存单轮 | 状态 |
|---|---|---|---|---|---|---|
| 第 1 轮 | 2,200 tokens | 0 / 2,200 | $0.03500 | $0.0350 | $0.03500 | 正常 |
| 第 2 轮 | 3,200 tokens | 3,000 / 200 | $0.02650 | $0.0615 | $0.04000 | 正常 |
| 第 3 轮 | 4,200 tokens | 4,000 / 200 | $0.02700 | $0.0885 | $0.04500 | 正常 |
| 第 4 轮 | 5,200 tokens | 5,000 / 200 | $0.02750 | $0.1160 | $0.05000 | 正常 |
| 第 5 轮 | 6,200 tokens | 6,000 / 200 | $0.02800 | $0.1440 | $0.05500 | 正常 |
| 第 6 轮 | 7,200 tokens | 7,000 / 200 | $0.02850 | $0.1725 | $0.06000 | 正常 |
| 第 7 轮 | 8,200 tokens | 8,000 / 200 | $0.02900 | $0.2015 | $0.06500 | 正常 |
| 第 8 轮 | 9,200 tokens | 9,000 / 200 | $0.02950 | $0.2310 | $0.07000 | 正常 |
| 第 9 轮 | 10,200 tokens | 10,000 / 200 | $0.03000 | $0.2610 | $0.07500 | 正常 |
| 第 10 轮 | 11,200 tokens | 11,000 / 200 | $0.03050 | $0.2915 | $0.08000 | 正常 |
| 第 11 轮 | 12,200 tokens | 12,000 / 200 | $0.03100 | $0.3225 | $0.08500 | 正常 |
| 第 12 轮 | 13,200 tokens | 13,000 / 200 | $0.03150 | $0.3540 | $0.09000 | 正常 |
| 第 13 轮 | 14,200 tokens | 14,000 / 200 | $0.03200 | $0.3860 | $0.09500 | 正常 |
| 第 14 轮 | 15,200 tokens | 15,000 / 200 | $0.03250 | $0.4185 | $0.10000 | 正常 |
| 第 15 轮 | 16,200 tokens | 16,000 / 200 | $0.03300 | $0.4515 | $0.10500 | 正常 |
| 第 16 轮 | 17,200 tokens | 17,000 / 200 | $0.03350 | $0.4850 | $0.11000 | 正常 |
| 第 17 轮 | 18,200 tokens | 18,000 / 200 | $0.03400 | $0.5190 | $0.11500 | 正常 |
| 第 18 轮 | 19,200 tokens | 19,000 / 200 | $0.03450 | $0.5535 | $0.12000 | 正常 |
| 第 19 轮 | 20,200 tokens | 20,000 / 200 | $0.03500 | $0.5885 | $0.12500 | 正常 |
| 第 20 轮 | 21,200 tokens | 21,000 / 200 | $0.03550 | $0.6240 | $0.13000 | 正常 |
* 策略与阶梯价说明:
- Anthropic 缓存写入规则: Prompt Caching 创建/更新写入价按基础 input 价格 1.25 倍计算,读取按 0.1 倍计算 (Source: Anthropic 官方 Docs, 2026-07-31 核验)。
- OpenAI / DeepSeek 规则: 自动前缀缓存无额外写入溢价,P_write = P_in。
- 长上下文阶梯价说明: 部分模型对超长上下文按更高阶梯价计费(数据带 tiers 字段),本计算器一律按基础档位单价估算。
常见问题
Q. 为什么单轮计算器算不准 Agent 的真实 API 账单?
Agent 的历史 Context 会逐轮回喂——第 k 轮进入 LLM 的 Token 数等于系统提示词 + 此前所有轮的用户输入、模型输出与工具返回结果之和。第 k 轮输入随轮数线性增长,N 轮总账单随之按平方量级膨胀。只按单轮估算会大幅低估实际开销。
Q. Prompt Caching (缓存) 能帮 Agent 省多少钱?
主流厂商(OpenAI、Anthropic、DeepSeek 等)支持对重复的前缀 Context 进行缓存,命中部分的读单价通常只有原输入价的 10%~50%。省多少取决于每轮新增 Token 占总输入的比例——把你的参数填进本工具,逐轮算出来。
Q. 为什么「轮间隔超过缓存 TTL」后成本反而可能更贵?
部分厂商(如 Anthropic 5 分钟 TTL)对显式写入缓存收取 1.25 倍的基础输入溢价。如果 Agent 两次 Task 调用间隔太长导致缓存失效,每一轮都会触发写入溢价却无法享受读取折扣,综合成本反而高于不使用缓存。
Q. 如何处理 Agent 的上下文爆窗问题?
当 S_in(k) + S_out 超过模型的 max context window 时,请求会报错或被强制截断。此时需要 Sliding Window (滑动窗口)、Summarization (定期总结) 或 Tool Result Truncation (工具输出截断) 等上下文管理策略。本工具会在爆窗轮次标红提示。