跳到主内容
算盘

Agent 多轮成本演化计算器

逐轮模拟 Agent 交互中历史对话与工具返回结果回喂带来的 Token 膨胀,算清 Prompt Cache 开启与 TTL 过期下的真实账单。单次输入求和?用 Token 估算器;对比本地算力与云 API 回本周期?用 本地 vs 云 API 回本计算器

计算参数设置

模拟多轮 Agent 交互中历史 Context 累积及 Prompt Cache 对成本的影响

tokens
tokens
tokens
tokens
OpenAI

GPT-5.5

$0.6240

20 轮总成本 (无缓存: $1.6500)

缓存节省率:62.18%
Anthropic

Claude Sonnet 4.6

$0.3309

20 轮总成本 (无缓存: $0.9420)

缓存节省率:64.87%

累计成本演化曲线 (1~20 轮)

对比不同模型随轮数增加的成本积累走势 (纯 SVG 渲染)

GPT-5.5
Claude Sonnet 4.6
$0.000$0.446$0.891$1.337$1.78211020

逐轮交互成本明细

轮数 (k)上下文 S_in缓存命中 / 新增单轮成本累计成本无缓存单轮状态
12,200 tokens0 / 2,200$0.03500$0.0350$0.03500正常
23,200 tokens3,000 / 200$0.02650$0.0615$0.04000正常
34,200 tokens4,000 / 200$0.02700$0.0885$0.04500正常
45,200 tokens5,000 / 200$0.02750$0.1160$0.05000正常
56,200 tokens6,000 / 200$0.02800$0.1440$0.05500正常
67,200 tokens7,000 / 200$0.02850$0.1725$0.06000正常
78,200 tokens8,000 / 200$0.02900$0.2015$0.06500正常
89,200 tokens9,000 / 200$0.02950$0.2310$0.07000正常
910,200 tokens10,000 / 200$0.03000$0.2610$0.07500正常
1011,200 tokens11,000 / 200$0.03050$0.2915$0.08000正常
1112,200 tokens12,000 / 200$0.03100$0.3225$0.08500正常
1213,200 tokens13,000 / 200$0.03150$0.3540$0.09000正常
1314,200 tokens14,000 / 200$0.03200$0.3860$0.09500正常
1415,200 tokens15,000 / 200$0.03250$0.4185$0.10000正常
1516,200 tokens16,000 / 200$0.03300$0.4515$0.10500正常
1617,200 tokens17,000 / 200$0.03350$0.4850$0.11000正常
1718,200 tokens18,000 / 200$0.03400$0.5190$0.11500正常
1819,200 tokens19,000 / 200$0.03450$0.5535$0.12000正常
1920,200 tokens20,000 / 200$0.03500$0.5885$0.12500正常
2021,200 tokens21,000 / 200$0.03550$0.6240$0.13000正常

* 策略与阶梯价说明:

  • Anthropic 缓存写入规则: Prompt Caching 创建/更新写入价按基础 input 价格 1.25 倍计算,读取按 0.1 倍计算 (Source: Anthropic 官方 Docs, 2026-07-31 核验)。
  • OpenAI / DeepSeek 规则: 自动前缀缓存无额外写入溢价,P_write = P_in。
  • 长上下文阶梯价说明: 部分模型对超长上下文按更高阶梯价计费(数据带 tiers 字段),本计算器一律按基础档位单价估算。

常见问题

Q. 为什么单轮计算器算不准 Agent 的真实 API 账单?

Agent 的历史 Context 会逐轮回喂——第 k 轮进入 LLM 的 Token 数等于系统提示词 + 此前所有轮的用户输入、模型输出与工具返回结果之和。第 k 轮输入随轮数线性增长,N 轮总账单随之按平方量级膨胀。只按单轮估算会大幅低估实际开销。

Q. Prompt Caching (缓存) 能帮 Agent 省多少钱?

主流厂商(OpenAI、Anthropic、DeepSeek 等)支持对重复的前缀 Context 进行缓存,命中部分的读单价通常只有原输入价的 10%~50%。省多少取决于每轮新增 Token 占总输入的比例——把你的参数填进本工具,逐轮算出来。

Q. 为什么「轮间隔超过缓存 TTL」后成本反而可能更贵?

部分厂商(如 Anthropic 5 分钟 TTL)对显式写入缓存收取 1.25 倍的基础输入溢价。如果 Agent 两次 Task 调用间隔太长导致缓存失效,每一轮都会触发写入溢价却无法享受读取折扣,综合成本反而高于不使用缓存。

Q. 如何处理 Agent 的上下文爆窗问题?

当 S_in(k) + S_out 超过模型的 max context window 时,请求会报错或被强制截断。此时需要 Sliding Window (滑动窗口)、Summarization (定期总结) 或 Tool Result Truncation (工具输出截断) 等上下文管理策略。本工具会在爆窗轮次标红提示。