我那个自动摘要小工具上线第二个月,账单是预估的三倍多。当时第一反应是模型选贵了,翻了半天后台才发现,真正的元凶是提示词越写越长,每请求多烧了一小截,请求量一大就滚成了四位数。
先说查这一环。别看总花了多少,要按模型、按接口、按天拆开看。 火山方舟 和 阿里云百炼 的控制台都能看每次调用的消耗,哪天突然跳起来一目了然。 智谱开放平台 的用量页也够细,能看到输入输出的占比。你要是图省事只看月总结,等发现时这个月已经烧过去了。
查完再看请求量。我那次发现八成调用来自同一个功能,一个每天跑几百次的批量任务。它单次成本不高,乘以次数就成了大头。这类「量大单便宜」的活最该单独挑渠道,我后来把它挪到 硅基流动 和 百度千帆 上跑开源权重,单价掉了一个量级,效果差别不大。
第三件事是加封顶。代码里写死一个每日上限,超了就返回一句「今天额度用完了」,而不是继续调。这一条我吃过亏,第一版忘了加,半夜被人刷了一波,第二天早上才在账单里看见。现在无论小工具还是正经项目,日上限都是必选项。
第四件是缓存。同样的输入别重复调,尤其是那种每周才变一次的数据,下达之后缓存起来,一周内直接读结果。我加了缓存那个月,调用量直接掉了一半,代码只改了十几行。
提示词也得瘦身。那阵子我总怕写不清楚,把背景、要求、例子堆了一屏,输出质量反而更稳但更贵,因为输入 token 全都要计费。后来我把例子压到最短,能一句话说清就别写两句,同样的活儿能省三分之一。
重试也要小心。接口超时就自动重试,写错成了三重,一次失败的代价变成三次。我改成只重试一次,且只在网络错误时重试,业务报错直接记日志放弃,成本立刻下来了。
输出长度能限就限。生成时给个上限,别让它想写多长写多长。摘要工具这种场景,两百字的输出和两千字的价格不是一回事,长出来的内容你多半不读。
日志是后面两步的前提。我给每次调用打标,记清楚哪个功能走了哪个模型、输入输出多少字符。哪天成本异常,翻日志比猜快十倍。不记日志,钱花哪儿自己都糊涂。
渠道别只留一家。 OpenRouter 这类统一入口的好处是换模型不用改代码,我把它当备胎,主渠道抽风就切过去。多接一家,心里踏实,也不用半夜爬起来改配置。
还有个坑是模型升级。平台悄悄换了默认模型,参数涨了但页面不提示。我后来把版本号锁死,要升级先小流量跑一天,确认输出没退化再全量。这一条省过我一次大亏。
省钱还有一条路是分级调度。简单的问题走便宜的档,只有它回答不上来才升级到贵的。我给摘要工具这么配过,日常九成的活儿走低价档,剩下那一成再上顶配,月度账单又降一截。判断该不该升级的规则要简单到你能一眼看懂,比如「回答里出现三个以上的含糊表述就升级」,别写复杂条件,写复杂了你也不敢改。
免费额度也别指望。刚注册的账号赠送额度看着不少,真放到生产里两三天就见底。拿它把流程跑顺可以,别把体验建立在它上面,正式用之前先算清楚付费那一档的月费是多少。
最后提醒一句,改完成本之后一定要跑一周观察。账单是滞后数据,今天省下来的要过几天才看得到。我每次调完都盯着日志看三天,确认调用量真的降了,才敢说这套方案有效。
如果现在就动手,我的顺序是:先看账单拆到天,再找量大的那个功能单独挑渠道,然后加日上限和缓存,最后回来压提示词。前面两步能解决我那八成的问题,后两步剩下的一成半。
想让你自己那个小工具也控住成本,先告诉我它每天大概调多少次、单次输出多少字,我按这个数帮你估个月预算上限,顺带看看哪一步最急。