反馈即训练
一条好的纠正长什么样,为什么它比点个踩有用得多。

本课目标
读完这一课,你将能够
- 说出一条好的纠正包含哪几个部分
- 把「不对,重来」改写成一条能直接用于训练的反馈
- 说清你的反馈进入训练循环之后会发生什么
为什么点个踩不够
点个踩,只告诉它「错了」,没告诉它错在哪、对的是什么、以后该怎么做。它的负责人看到这个踩,也只能去猜。点踩至少说明这里有问题,但它只是一个信号,还算不上训练素材。
训练数字员工,改的不是模型本身,而是它的资料、岗位说明书、流程和记忆。要改对地方,先得知道问题出在哪一处,而最清楚这一点的,是当时在场的你。所以你写下的每一条纠正,都是它的训练素材。
| 点个踩 | 一条好的纠正 | |
|---|---|---|
| 它知道了什么 | 这次不对 | 错在哪、对的是什么、依据在哪 |
| 负责人能做什么 | 只能猜原因 | 直接判断是缺资料、口径乱,还是职责不清 |
| 下一次 | 可能还犯同样的错 | 同类情况按新规矩做 |
| 能不能进考题 | 用不上 | 变成一道考题,以后每次复验都会用到 |
一条好纠正的四个部分
- 指出是哪一次
哪个问题、哪份回答。最好直接引用原话,或者截图。
- 说清错在哪
具体到一句话、一个数字,不要只说「不太对」。
- 给出对的和依据
正确的应该是什么,依据哪份制度、哪张单据。
- 说出以后的规矩
以后遇到同类情况,该怎么处理。
拿财务数字员工的报销初审做个对照:
「这个不对吧?重新审一下。」
「昨天的差旅报销初审里,你把一张高铁一等座车票判为超标。按现行的差旅管理规定,部门经理及以上可以乘坐一等座,这位同事是部门经理,这张票不超标。以后初审交通费时,先查报销人的职级,再对照规定里的标准。」
好的那一条多花了半分钟,但四个部分都在:哪一次、错在哪、对的和依据、以后的规矩。负责人拿到它,不用再回头问你任何问题。
你的反馈去了哪里
每位数字员工都有一位负责人。负责人每周花十五到三十分钟,复核它的工作和收到的反馈,按下面四步一轮轮改进它:
- 01观察收集运行记录、复核中发现的失败,以及大家的纠正
- 02诊断判断问题出在哪:缺资料、口径乱、记忆错、职责不清、没有流程,还是能力上限
- 03处方对症去改:补文件、定口径、修说明书、写成流程
- 04复验重新考一遍,你的那条纠正变成一道考题
诊断先于处方,不能「感觉不对就改提示词」。你的反馈写得越具体,诊断就越准,改得也越对。六种原因里,前五种都能在组织这一层补上;只有能力上限要等模型升级,这时负责人会收窄它的任务,而不是硬上。
除了纠正答错的地方,还有两类反馈同样值得提:它还做不到的事,以及你觉得公网工具做得更好的事。这两类直接决定下一轮先训练什么,提出来的人,就是在给自己的部门排优先级。
你不是在给 AI 找茬,你是在训练自己的数字同事。
要点
- 点个踩只说「错了」;好的纠正说清错在哪、对的是什么、以后怎么做。
- 好纠正的四个部分:哪一次、错在哪、对的和依据、以后的规矩。
- 训练改的是资料、说明书、流程和记忆,不是模型本身。
- 负责人按观察、诊断、处方、复验使用你的反馈,你的纠正会变成考题。
练一练
写一条能用的纠正
回想一次数字员工答错或做得不够好的经历,把它写成一条好的纠正。
按「哪一次、错在哪、对的和依据、以后的规矩」写出来,每段一两句。
你觉得问题出在哪:缺资料、口径乱、职责不清,还是没有流程?把判断写在最后。
把这条纠正发给数字员工,或交给它的负责人。一周后再问一次同样的问题,看它有没有改过来。
小测
选一个答案,马上看解析。
Q1下面哪条反馈最能直接用于训练?
它指出了哪一处、错在哪、对的依据在哪,还给出了以后的规矩。
Q2训练数字员工时,主要改的是什么?
训练不改模型本身,改的是围绕模型的那一层;而且要先诊断再开处方,不能感觉不对就改提示词。
Q3你的一条纠正被负责人采纳后,还会发挥什么作用?
失败案例会汇入考题,考题随数字员工一起成长,同样的错就不容易再犯。