用量与成本分析

数字员工的成本由两部分构成:模型推理的用量费,和承载它们的服务器费。这一页说明这两部分各自怎么算、怎么分摊到部门与数字员工、以及为什么系统坚持用实际账单而不是价目表来对账。

// 一句话理解

成本分析回答两个问题:每个数字员工这个月花了多少,以及账单里有多少钱没有落在任何在用资源上。第二个问题往往更值钱——它是浪费信号。

两类成本

推理用量Inference

数字员工每次思考与回答消耗的模型用量,按输入、输出与缓存命中分别计费。它随使用量波动,是可以通过改进提示、精简资料范围、启用缓存来优化的部分。粒度可以下钻到单个数字员工、单个模型、单天。

承载资源Infrastructure

运行时服务器、存储与网络。它基本不随使用量波动,只随「开了几台、开了多久、挂了多少盘」变化。它是固定成本,优化方式是关停闲置资源与调整机型,而不是改提示词。

口径:实际账单优先

同一台服务器,按价目表估算和按实际账单计算,结果经常差出可观的比例——预留折扣、按量计费的阶梯、区域差价都会影响它。系统的处理方式是:

分摊恒等式

成本分摊必须满足一个恒等式:每台服务器的分摊额之和 + 未归属金额 = 账单总额。分摊器既不发明金额,也不吞掉金额。凡是无法归属到某台在管服务器的支出,全部进入「未归属」并附上原因:

未归属原因含义通常的处理
已销毁的实例本月运行过但已被删除的服务器正常,确认是计划内的下线即可
孤儿磁盘未挂载在任何实例上、仍在计费的存储卷确认无用后删除——最常见的静默浪费
闲置的固定地址已分配但未绑定的公网地址释放
快照历史备份的存储费按保留策略清理
月中改配的未归属时段机型变更前后的部分小时正常,金额通常很小
// 排查提示

账单突然跳变时,先查「是不是换了模型或换了供应商车道」,再查用量。不同模型之间的单价差异可以达到数十倍,而这种变更往往只是一行配置,很容易在事后被忘记。第二顺位才查定时任务与异常重试。

按什么维度看

维度回答的问题
按数字员工哪个岗位最贵?它的产出配得上这个成本吗?
按部门这个部门的 AI 预算用掉多少?还剩多少?
按模型贵的那部分用量是不是可以换成更便宜的模型完成?
按服务器这台机器承载了多少产出?能不能合并或降配?
按天是持续升高还是某天的异常?异常那天发生了什么?

成本优化的顺序

  1. 先清浪费。孤儿磁盘、闲置地址、忘关的服务器。这部分不影响任何人的工作,纯粹是省下来的。
  2. 再调资料范围。数字员工每次带的资料越多越贵。缩小到真正需要的范围,通常同时提高准确率。
  3. 然后按任务选模型。常规问答与复杂推理不必用同一档模型。分档之后成本结构通常显著改变。
  4. 最后调机型。合并低负载实例、按实际内存与 CPU 占用调整规格。这一步影响面最大,放在最后。

相关阅读