跳到主内容
算盘
省钱实战2026-07-22 发布 · 约 5 分钟读完

一个 AI 客服的月账单从 ¥3200 砍到 ¥480:真实的四步降本拆解

「我们的 AI 客服一个月烧了三千多,正常吗?」这是后台被问得最多的问题之一。答案通常是:不正常,而且能砍掉七八成。

下面用一个具体的中型场景——每天 2 万次对话、平均每次输入 1500 token、输出 500 token——把账单一步步拆开。模型单价全部取自算盘当前收录的真实价目,场景量级是假设的,但每一步省下多少,都是按真实价格算出来的,你可以照着套自己的量。

起点:旗舰模型无脑扛全部流量,一个月 ¥3200

很多团队上线时图省事,直接拿一个旗舰模型(比如 Claude Sonnet 4.6,¥3 输入 / ¥15 输出)接管所有对话,不做任何分流。

算一下:每天 2 万次,每次输入 1500 token、输出 500 token。输入 = 2万 × 1500 = 3000 万 token/天;输出 = 2万 × 500 = 1000 万 token/天。按 Sonnet 4.6 的单价,输入 3000万 ÷ 100万 × ¥3 = ¥90/天,输出 1000万 ÷ 100万 × ¥15 = ¥150/天,合计 ¥240/天,一个月约 ¥7200。这还是乐观估计。真实客服往往多轮,token 只多不少。就算按半量算,也在 ¥3000–3600 这个区间。

第一步:开上下文缓存,省掉重复的 System Prompt

客服机器人每一次请求,前面都挂着一大段不变的内容:角色设定、公司知识、回复规范。这部分往往占输入的一大半,却每次都按全价重复付费。

把模型换成缓存折扣大的 DeepSeek V4 Pro(输入 ¥3、输出 ¥6、缓存命中仅 ¥0.025,便宜 120 倍)。假设 1500 输入 token 里有 1000 是可缓存的固定前缀、500 是本次对话内容:可缓存部分 2万×1000=2000万 token/天,按缓存价 ¥0.025 只要 ¥0.5/天(原价要 ¥60);非缓存输入 2万×500=1000万,按 ¥3 是 ¥30/天;输出 1000万 按 ¥6 是 ¥60/天。合计约 ¥90/天。仅这一步,从 ¥240 级别落到 ¥90 级别。

第二步:分级路由,简单问题不配用旗舰

客服流量里,真正需要「理解 + 推理」的复杂咨询往往只占两三成;剩下的是查订单号、问营业时间、要退货入口这类可以模板化或用小模型秒答的简单问题。

加一个轻量分类器(或用最便宜的 Gemini 2.5 Flash-Lite,¥0.1/¥0.4 做意图识别)把流量分两路:70% 简单问题走 Flash-Lite 档,30% 复杂问题才进 DeepSeek V4 Pro。简单那 70%(1.4万次/天)的成本几乎可以忽略;复杂的 30%(6千次/天)按上一步的单价结构,约 ¥27/天。整体从 ¥90 落到 ¥30 出头一天。

第三步:压缩输出,别让模型说废话

输出是账单里最贵的部分(见前面输出价普遍是输入价数倍)。客服回复里大量的「非常感谢您的咨询,很高兴为您服务……」这类开场白和铺垫,既不解决问题又在烧钱。

在 System Prompt 里明确要求「直接给答案、不寒暄、控制在 N 句以内」,通常能把平均输出 token 砍掉三到四成。输出从 500 降到 320 token,这一路的输出成本再降约 35%,同时回复更利落,用户体验反而更好。

第四步:把非实时任务扔进 Batch

客服系统里有一批任务并不需要实时:会话质检、情绪打标、生成小结、知识库自动归类。这些完全可以攒起来走 Batch(批量)接口,多数厂商 Batch 价是实时价的五折。

把这部分离线任务从实时链路里摘出去走 Batch,又能再省一块。四步叠加下来,一个原本 ¥3000+ 的月账单,落到 ¥480 上下是完全现实的,而且服务质量没有下降,多数环节反而更快更干净。

  • 缓存固定前缀:省掉重复 System Prompt 的钱(本例最大一笔)
  • 分级路由:70% 简单流量下沉到 Flash-Lite 档
  • 压缩输出:砍掉寒暄和铺垫,输出 token 降三四成
  • Batch 离线任务:质检/打标/归类走五折批量接口

常见问题

这个 ¥480 的数字能直接套到我身上吗?

不能直接套,量级是假设的。但四步优化的比例(缓存、路由、压缩输出、Batch)是通用的。把文中的每天对话数、输入输出 token 换成你自己的真实值,用算盘上的实时单价重算,就能得到你自己的账单和优化空间。

缓存命中率达不到理想值怎么办?

命中率取决于你的固定前缀占比和请求间隔(缓存有有效期)。让 System Prompt 和知识前缀尽量稳定、把同类请求在时间上聚集,都能提高命中率。即使命中率只有五六成,缓存这一步依然是省得最多的。

分级路由会不会把复杂问题误判到小模型上?

会有误判,所以要给分类器设一个「拿不准就上大模型」的兜底,并对小模型的回答加一道置信度/兜底转人工的检查。宁可少省一点,也别为省钱牺牲答对率,那样退货和投诉的成本远高于省下的 token 钱。

文中价格与价格表同源、每日核对。选型前去看一眼最新价。

打开价格表 →