用量与成本分析
数字员工的成本由两部分构成:模型推理的用量费,和承载它们的服务器费。这一页说明这两部分各自怎么算、怎么分摊到部门与数字员工、以及为什么系统坚持用实际账单而不是价目表来对账。
// 一句话理解
成本分析回答两个问题:每个数字员工这个月花了多少,以及账单里有多少钱没有落在任何在用资源上。第二个问题往往更值钱——它是浪费信号。
两类成本
推理用量Inference数字员工每次思考与回答消耗的模型用量,按输入、输出与缓存命中分别计费。它随使用量波动,是可以通过改进提示、精简资料范围、启用缓存来优化的部分。粒度可以下钻到单个数字员工、单个模型、单天。
承载资源Infrastructure运行时服务器、存储与网络。它基本不随使用量波动,只随「开了几台、开了多久、挂了多少盘」变化。它是固定成本,优化方式是关停闲置资源与调整机型,而不是改提示词。
口径:实际账单优先
同一台服务器,按价目表估算和按实际账单计算,结果经常差出可观的比例——预留折扣、按量计费的阶梯、区域差价都会影响它。系统的处理方式是:
- 费率自校准。每种资源的实际时费 = 该资源这个月的实际账单金额 ÷ 实际计费小时数。不使用价目表推算已发生的费用。
- 价目表只用于预估。「按当前配置未来 30 天大约多少钱」这类前瞻性投影才用价目表,并且在界面上与实账明确分开标注。
- 运行时长来自监控,不来自开机记录。「最近一次启动时间」会说谎——一台中途重启过的机器,用它推算出的运行小时数是错的。计费小时以监控数据点为准。
- 币种与含税状态固定。金额统一以一种币种、未税呈现;汇率换算只发生在展示层,不进入账目。
分摊恒等式
成本分摊必须满足一个恒等式:每台服务器的分摊额之和 + 未归属金额 = 账单总额。分摊器既不发明金额,也不吞掉金额。凡是无法归属到某台在管服务器的支出,全部进入「未归属」并附上原因:
| 未归属原因 | 含义 | 通常的处理 |
|---|---|---|
| 已销毁的实例 | 本月运行过但已被删除的服务器 | 正常,确认是计划内的下线即可 |
| 孤儿磁盘 | 未挂载在任何实例上、仍在计费的存储卷 | 确认无用后删除——最常见的静默浪费 |
| 闲置的固定地址 | 已分配但未绑定的公网地址 | 释放 |
| 快照 | 历史备份的存储费 | 按保留策略清理 |
| 月中改配的未归属时段 | 机型变更前后的部分小时 | 正常,金额通常很小 |
// 排查提示
账单突然跳变时,先查「是不是换了模型或换了供应商车道」,再查用量。不同模型之间的单价差异可以达到数十倍,而这种变更往往只是一行配置,很容易在事后被忘记。第二顺位才查定时任务与异常重试。
按什么维度看
| 维度 | 回答的问题 |
|---|---|
| 按数字员工 | 哪个岗位最贵?它的产出配得上这个成本吗? |
| 按部门 | 这个部门的 AI 预算用掉多少?还剩多少? |
| 按模型 | 贵的那部分用量是不是可以换成更便宜的模型完成? |
| 按服务器 | 这台机器承载了多少产出?能不能合并或降配? |
| 按天 | 是持续升高还是某天的异常?异常那天发生了什么? |
成本优化的顺序
- 先清浪费。孤儿磁盘、闲置地址、忘关的服务器。这部分不影响任何人的工作,纯粹是省下来的。
- 再调资料范围。数字员工每次带的资料越多越贵。缩小到真正需要的范围,通常同时提高准确率。
- 然后按任务选模型。常规问答与复杂推理不必用同一档模型。分档之后成本结构通常显著改变。
- 最后调机型。合并低负载实例、按实际内存与 CPU 占用调整规格。这一步影响面最大,放在最后。