反馈即训练

第 6 课 · 共 6 课 约 8 分钟

一条好的纠正长什么样,为什么它比点个踩有用得多。

本课目标

读完这一课,你将能够

  • 说出一条好的纠正包含哪几个部分
  • 把「不对,重来」改写成一条能直接用于训练的反馈
  • 说清你的反馈进入训练循环之后会发生什么

为什么点个踩不够

点个踩,只告诉它「错了」,没告诉它错在哪、对的是什么、以后该怎么做。它的负责人看到这个踩,也只能去猜。点踩至少说明这里有问题,但它只是一个信号,还算不上训练素材。

训练数字员工,改的不是模型本身,而是它的资料、岗位说明书、流程和记忆。要改对地方,先得知道问题出在哪一处,而最清楚这一点的,是当时在场的你。所以你写下的每一条纠正,都是它的训练素材。

点个踩一条好的纠正
它知道了什么这次不对错在哪、对的是什么、依据在哪
负责人能做什么只能猜原因直接判断是缺资料、口径乱,还是职责不清
下一次可能还犯同样的错同类情况按新规矩做
能不能进考题用不上变成一道考题,以后每次复验都会用到

一条好纠正的四个部分

  1. 指出是哪一次

    哪个问题、哪份回答。最好直接引用原话,或者截图。

  2. 说清错在哪

    具体到一句话、一个数字,不要只说「不太对」。

  3. 给出对的和依据

    正确的应该是什么,依据哪份制度、哪张单据。

  4. 说出以后的规矩

    以后遇到同类情况,该怎么处理。

拿财务数字员工的报销初审做个对照:

随口一问

「这个不对吧?重新审一下。」

好的交代

「昨天的差旅报销初审里,你把一张高铁一等座车票判为超标。按现行的差旅管理规定,部门经理及以上可以乘坐一等座,这位同事是部门经理,这张票不超标。以后初审交通费时,先查报销人的职级,再对照规定里的标准。」

好的那一条多花了半分钟,但四个部分都在:哪一次、错在哪、对的和依据、以后的规矩。负责人拿到它,不用再回头问你任何问题。

你的反馈去了哪里

每位数字员工都有一位负责人。负责人每周花十五到三十分钟,复核它的工作和收到的反馈,按下面四步一轮轮改进它:

  1. 01观察收集运行记录、复核中发现的失败,以及大家的纠正
  2. 02诊断判断问题出在哪:缺资料、口径乱、记忆错、职责不清、没有流程,还是能力上限
  3. 03处方对症去改:补文件、定口径、修说明书、写成流程
  4. 04复验重新考一遍,你的那条纠正变成一道考题

诊断先于处方,不能「感觉不对就改提示词」。你的反馈写得越具体,诊断就越准,改得也越对。六种原因里,前五种都能在组织这一层补上;只有能力上限要等模型升级,这时负责人会收窄它的任务,而不是硬上。

除了纠正答错的地方,还有两类反馈同样值得提:它还做不到的事,以及你觉得公网工具做得更好的事。这两类直接决定下一轮先训练什么,提出来的人,就是在给自己的部门排优先级。

你不是在给 AI 找茬,你是在训练自己的数字同事。

要点

  • 点个踩只说「错了」;好的纠正说清错在哪、对的是什么、以后怎么做。
  • 好纠正的四个部分:哪一次、错在哪、对的和依据、以后的规矩。
  • 训练改的是资料、说明书、流程和记忆,不是模型本身。
  • 负责人按观察、诊断、处方、复验使用你的反馈,你的纠正会变成考题。

练一练

写一条能用的纠正

回想一次数字员工答错或做得不够好的经历,把它写成一条好的纠正。

按「哪一次、错在哪、对的和依据、以后的规矩」写出来,每段一两句。

小测

选一个答案,马上看解析。

Q1下面哪条反馈最能直接用于训练?

Q2训练数字员工时,主要改的是什么?

Q3你的一条纠正被负责人采纳后,还会发挥什么作用?

延伸阅读