Zhiyuan Research
← 返回文章
已发布约 3 分钟

LLM 时代的知识工程:从文档管理到可操作的知识系统

当大语言模型成为知识的主要消费者之一,知识工程的对象、方法和评价标准都在变化。本文给出一个面向人机共读的知识系统框架。

目录

传统知识管理的核心问题是”存起来找不到”,而 LLM 时代的核心问题变成了”找到了用不好”。这篇文章讨论这个转变,以及它对个人和企业知识系统设计的含义。

从”图书馆”到”工作台”

图书馆式知识系统的假设是:用户知道自己要找什么,找到之后自己会读完。这个假设在两种情况下失效:

  1. 使用者的先验不足——新手不知道该检索什么;
  2. 使用者不是人——LLM 没有”自己去读完”的耐心概念,它只接受被裁剪好的上下文。

因此知识系统的基本单元需要重新设计。与其问”这篇文档放在哪个文件夹”,不如问:

  • 这条知识解决什么问题?(问题锚点)
  • 它在什么条件下成立?(适用边界)
  • 它和哪些概念相互依赖?(关系网络)

一个三层框架

我把面向人机共读的知识系统分成三层:

抽象组合读写判断原始材料概念层决策层LLM
图 1:知识系统的三层结构

原始材料层保存来源:论文、会议记录、现场观察。概念层把材料抽象成稳定的概念和关系。决策层面向具体问题,把概念组合成行动依据。LLM 在概念层读写,人在决策层判断——这是我认为比较合理的人机分工。

一个微小的实证

我在自己维护的三类内容上做了对比:传统文件夹笔记、带主题聚合的数字花园、以及为 LLM 裁剪过的结构化摘要。让同一个模型回答 20 个需要跨文档综合的问题,结果如下(示例数据):

20416181文件夹: 45%文件夹数字花园: 62%数�字花园结构化摘要: 81%结构化摘要
图 2:不同知识组织方式下的回答正确率(示例数据)

结构化摘要明显胜出并不意外:它本质上是为模型”预制了上下文”。真正值得注意的数字是数字花园也显著优于文件夹——只要存在显式的主题聚合,机器的可用性就大幅提升

对个人网站的含义

这也是本站采用 Topics 作为一等公民的原因。Topic 不是标签,而是知识系统里的”概念锚点”:文章、笔记、阅读记录和项目都挂接到主题上,主题页自动聚合出一个小型知识视图。

示例:嵌入 B 站视频(点击后加载)

局限与下一步

这个框架目前有三个未解决的问题:

下一步我计划把 制造图谱浏览器项目 作为试验场,在真实的工艺知识上检验这三层结构。相关的精益视角讨论见上一篇文章

相关内容