知识库与语料治理
知识库是「AI 可读语料」的治理层。它不是网盘——网盘管的是工作目录里的文件操作;知识库管的是语料的收录、分级、投送与检索,保证数字员工引用的每一句话都落对了位置、对得上权限、找得到出处。
知识库回答四件事:这份材料落在哪、谁能看、数字员工读不读得到、回答能不能溯源。四件事都成立,语料才算收录成功;只是「文件传上去了」不算。
知识库与云盘的区别
两者共用同一套文件面(浏览、上传、搜索的界面完全一致),但服务的是不同目的。分清楚它们,能省掉大量「为什么 AI 看不到我刚传的文件」的困惑。
| 云盘(工作目录) | 知识库 | |
|---|---|---|
| 装什么 | 正在被处理的文件:草稿、中间产物、待办材料 | 需要被反复引用的语料:制度、规范、手册、历史方案 |
| 生命周期 | 跟着任务走,任务结束就归档或删除 | 跟着组织走,长期存在并持续被引用 |
| 物理位置 | 部门运行时所在服务器的文件系统 | 公司级中央对象存储,不与任何一台服务器共存亡 |
| 检索范围 | 按路径与文件名,属于当前工作区 | 按内容与术语,跨部门(受分级裁剪) |
| 典型问题 | 「这次的报价单在哪」 | 「我们公司对超期付款的规定是什么,出处是哪一版制度」 |
为什么知识库必须在公司层,而不在服务器上
一家公司往往不止一台运行时服务器——出于隔离要求,财务、人事这类部门通常独占自己的机器。如果知识库以某台服务器的文件系统为真源,那么「公司级知识」在物理上就不存在,只有「某台机器上的知识」:财务部门的数字员工读不到公司制度文件,而公司级恰恰是最常用的一级。
因此知识库的底座是每家公司一个中央对象存储桶,前缀即权限边界,与运行时服务器解耦。这带来三个直接结果:
- 知识资产不与计算资源同生命周期。服务器可以重建、扩容、迁移,知识库不受影响。
- 公司级语料对所有部门可见(在分级允许范围内)。不再出现「制度文件只有主服务器有」的结构性缺口。
- 加密与撤销是公司级的。每家公司一把独立密钥;合作结束时撤销密钥即可秒级切断访问,清算干净。
收录链路:从原始材料到可引用结论
语料不是传上去就能用。知识库把它推过四段,每一段都产出一个更稳定、更容易被正确引用的形态:
Source原始材料上传的原文件本身,永远保留。它是所有下游产物的出处,任何引用最终都要能指回这里的某一页、某一段。
Summary结构化摘要由部门自己的数字员工在本地生成的要点摘要:这份材料讲什么、适用范围、关键条款、生效时间。摘要是稳定层的核心产物——检索命中的通常是摘要,展开才看原文。
Glossary术语与词条从语料中沉淀出的企业术语:一个词在这家公司里到底指什么。术语层让不同部门说同一个词时指的是同一件事,也是语义模型的孵化源。
Experience经验条目被验证过的做法与判断:某类问题过去怎么处理、结果如何。经验条目是唯一允许被数字员工当作「组织共识」引用的层,其它层只是材料。
不做扁平向量检索。知识库的检索以关键词与结构化字段为主干,来源按可信度分层,模型只承担提炼与排序的辅助角色——企业问答要的是「可对账」,不是「大概相关」。
分级与可见性
每个知识库前缀绑定一个共享范围,与全平台统一的三级分级一致:Company(全公司可见)、Department(本部门可见)、Group(指名白名单可见)。裁剪在检索层就发生:不可见的语料不会出现在结果里,也不会以「有一条你看不到」的形式暴露存在性。
数字员工与人适用同一套分级。一个部门的数字员工能引用的语料范围,不会超过该部门的人能看的范围——这是「AI 权限不高于岗位权限」原则在语料层的落实。
用户面只有两态
上传者只看到两个状态:上传成功与收录成功。前者表示文件已到达知识库,后者表示摘要已生成、已进入检索、可以被引用。解析、切分、索引这类技术状态留在后台与日志里——把它们暴露给业务用户,只会产生无法行动的焦虑。