评估与考核(Evals)
数字员工和人类员工一样:上岗前要考试,上岗后要绩效考核。AIDC 把评估(Evals,对 Agent 工作质量的系统化测试)当作治理手段,而不只是质量检查——每个上线的工作流都有自己的题库、通过率门槛与考核档案。信任来自「可解释 + 可审计 + 严格评估」,不来自演示效果。
// 一句话理解
把数字员工当员工管:上岗前用这家公司的真实业务出考题,通过率达不到门槛就不上线,没有例外;上岗后犯过的错回流进题库,考题随员工一起成长。演示再惊艳也不算成绩,证据说了算。
为什么评估是治理,不只是 QA
传统软件测试验证的是「代码是否按写的运行」,跑通一次就算过。Agent 不一样:输出是非确定性的——同一道题,每次回答可能不同。所以评估不是上线前跑一遍的检查项,而是贯穿数字员工整个任职周期的管理制度,它回答的是一个治理问题:这位数字员工的工作质量是否稳定达标,这件事能不能放心交给它。
- 上线靠证据 — 任何 Agent 或工作流上线(包括版本晋级)必须有评估记录。这不是建议,是 AI 治理基线的执行标准之一;
- 演示不算数 — 演示展示的是「发挥最好的一次」,评估衡量的是平均水平与最差情况。等级评定与验收一律看评估证据,不看现场演示;也不用调用次数、对话量、生成字数这类虚荣指标衡量能力(反虚荣条款);
- 考核贯穿任职周期 — 入职建题库、试用期盯每日通过率、在岗周期重考、换模型全套重考——考核伴随数字员工的全部任职周期,不是一次性的入职测试。
术语表:考核体系的五个部件
评估体系的术语与业界生产级评估框架对齐。用绩效考核来类比,每个部件都有熟悉的对应物:
| 术语 | 定义 | 绩效考核类比 |
|---|---|---|
| Evaluation Suite(评估套件) | 某个数字员工/工作流的完整测试集合:测试用例 + 评估对象 + 评分函数 | 一套完整的考卷与评分标准 |
| Test Case(测试用例) | 一组输入与期望输出 | 一道考题与它的标准答案 |
| Target(评估对象) | 被评估的 Agent 任务或工作流 | 参加考核的那个岗位 |
| Evaluation Function(评分函数) | 判定输出是否合格的方式:精确匹配、规则判定、模型阅卷(LLM-as-judge,用另一个模型当阅卷人)或人工抽检 | 客观题机器判卷,主观题阅卷人评分 |
| Metrics(指标) | 通过率、错误模式分布、跨版本对比 | 成绩单与错题分析 |
最低要求五条
- 每个部署工作流一个评估套件 — 考题来自客户真实样本(脱敏处理),至少 10 条,覆盖主路径与已知边界情况——考的是这家公司的真实业务,不是通用题库;
- 非确定性输出至少跑三次 — 看方差,不看单次结果:一次答对可能是运气,三次稳定才是能力;
- 换模型必须重跑全套 — 模型升级按发布通道规则进行,不直接替换生产模型——新模型更聪明,不代表在你的业务上更稳;
- 生产反馈回流 — 人工复核中发现的失败案例,每月汇入评估套件——题库随部署一起长大,犯过的错从此都在考核范围内;
- 评估记录归档 — 每次考核留档:版本、模型、通过率、失败模式——绩效档案完整可追溯,上线与晋级都以它为前置证据。
按风险分级的上线门槛
不同风险的工作流,考核标准不同:越接近对外动作与审批流,门槛越高、附加要求越严。这与人类组织的逻辑一致——写内部草稿的实习生和对外签字的负责人,考核标准本来就不该一样。
| 工作流风险级 | 通过率门槛 | 附加要求 |
|---|---|---|
| 低(内部草稿类) | ≥85% | — |
| 中(写入客户文件系统) | ≥90% | 失败模式全部有兜底路径 |
| 高(触发对外动作或审批流) | ≥95% | 人工复核点强制 + 灰度运行 2 周 |
门槛与等级评定直接挂钩:部署等级(ADL)的晋级在季度复盘时凭证据包评定——评估记录、操作日志(ActionLog)抽查、闭环清单——任何一项达成条件不满足就不晋级,无例外。这正是「证据评定,不靠演示」的含义:等级是考出来的,不是演示出来的。
考核与训练循环的关系
评估不是孤立的考试,它嵌在数字员工的训练循环「观察 → 诊断 → 处方 → 复验」里,承担三个角色:
- 复验的标尺 — 每轮训练开出的处方(补资料、统一口径、修订职责说明书、沉淀 SOP)落地后,用评估重跑确认改进——改没改好,分数说了算,不靠感觉;
- 题库的来源 — 训练中观察到的失败案例按月汇入评估套件——这位员工犯过的错,从此都是必考题,同样的错误不会无声重犯;
- 晋升的依据 — 「考核与晋升」阶段周期性重跑评估;扩权(新目录、新动作)必须走权限评审——晋升的核心材料是成绩单,不是 owner 的个人印象。
// 治理规则
不达标不上线,无例外:任何工作流未达到其风险级的通过率门槛,不进入生产;任何晋级条件缺一条,不晋级。评估记录是上线与晋级的前置证据,不是事后补办的文档。
相关阅读
- 数字员工训练与管理 — 考核在训练循环与六段生命周期中的位置
- Agentic 部署等级(ADL) — 凭证据晋级的等级体系与评定规则
- AI 治理基线(上线八条) — 「上线必须有评估记录」的治理依据
- Agent 记忆模型 — 记忆审计与考核共同守住数字员工的行为质量