评估与考核(Evals)

数字员工和人类员工一样:上岗前要考试,上岗后要绩效考核。AIDC 把评估(Evals,对 Agent 工作质量的系统化测试)当作治理手段,而不只是质量检查——每个上线的工作流都有自己的题库、通过率门槛与考核档案。信任来自「可解释 + 可审计 + 严格评估」,不来自演示效果。

// 一句话理解

把数字员工当员工管:上岗前用这家公司的真实业务出考题,通过率达不到门槛就不上线,没有例外;上岗后犯过的错回流进题库,考题随员工一起成长。演示再惊艳也不算成绩,证据说了算。

为什么评估是治理,不只是 QA

传统软件测试验证的是「代码是否按写的运行」,跑通一次就算过。Agent 不一样:输出是非确定性的——同一道题,每次回答可能不同。所以评估不是上线前跑一遍的检查项,而是贯穿数字员工整个任职周期的管理制度,它回答的是一个治理问题:这位数字员工的工作质量是否稳定达标,这件事能不能放心交给它。

术语表:考核体系的五个部件

评估体系的术语与业界生产级评估框架对齐。用绩效考核来类比,每个部件都有熟悉的对应物:

术语定义绩效考核类比
Evaluation Suite(评估套件)某个数字员工/工作流的完整测试集合:测试用例 + 评估对象 + 评分函数一套完整的考卷与评分标准
Test Case(测试用例)一组输入与期望输出一道考题与它的标准答案
Target(评估对象)被评估的 Agent 任务或工作流参加考核的那个岗位
Evaluation Function(评分函数)判定输出是否合格的方式:精确匹配、规则判定、模型阅卷(LLM-as-judge,用另一个模型当阅卷人)或人工抽检客观题机器判卷,主观题阅卷人评分
Metrics(指标)通过率、错误模式分布、跨版本对比成绩单与错题分析

最低要求五条

  1. 每个部署工作流一个评估套件 — 考题来自客户真实样本(脱敏处理),至少 10 条,覆盖主路径与已知边界情况——考的是这家公司的真实业务,不是通用题库;
  2. 非确定性输出至少跑三次 — 看方差,不看单次结果:一次答对可能是运气,三次稳定才是能力;
  3. 换模型必须重跑全套 — 模型升级按发布通道规则进行,不直接替换生产模型——新模型更聪明,不代表在你的业务上更稳;
  4. 生产反馈回流 — 人工复核中发现的失败案例,每月汇入评估套件——题库随部署一起长大,犯过的错从此都在考核范围内;
  5. 评估记录归档 — 每次考核留档:版本、模型、通过率、失败模式——绩效档案完整可追溯,上线与晋级都以它为前置证据。

按风险分级的上线门槛

不同风险的工作流,考核标准不同:越接近对外动作与审批流,门槛越高、附加要求越严。这与人类组织的逻辑一致——写内部草稿的实习生和对外签字的负责人,考核标准本来就不该一样。

工作流风险级通过率门槛附加要求
(内部草稿类)≥85%
(写入客户文件系统)≥90%失败模式全部有兜底路径
(触发对外动作或审批流)≥95%人工复核点强制 + 灰度运行 2 周

门槛与等级评定直接挂钩:部署等级(ADL)的晋级在季度复盘时凭证据包评定——评估记录、操作日志(ActionLog)抽查、闭环清单——任何一项达成条件不满足就不晋级,无例外。这正是「证据评定,不靠演示」的含义:等级是考出来的,不是演示出来的。

考核与训练循环的关系

评估不是孤立的考试,它嵌在数字员工的训练循环「观察 → 诊断 → 处方 → 复验」里,承担三个角色:

// 治理规则

不达标不上线,无例外:任何工作流未达到其风险级的通过率门槛,不进入生产;任何晋级条件缺一条,不晋级。评估记录是上线与晋级的前置证据,不是事后补办的文档。

相关阅读