作者:互联网 时间: 2026-08-13 10:15:56
最近一直在折腾知识库的事,有些体会想记录下来。

我先后用过Notion、飞书文档、Obsidian。做法都差不多:看到有用的文章剪藏下来,写完的工作文档存进去,打个标签分个类,再弄个双链连一下。
主流的个人知识库工具,基本就到这个程度了。能存、能搜、有的加了个AI问答。乍一看挺像回事,但用久了就发现一个问题——
存进去的东西,到底形成了什么知识?怎么指导我下次干活?没有。
举个例子。我每次写完报告都有初稿到定稿的十几个版本。这些版本文件我都存了。但下次写报告的时候,我还是从头来,该犯的错还是犯,该查的格式还是查。
那些存进去的文档,只是躺在那里。它们之间的关系是什么?修改过程中哪些错误最常见?什么样的结构最合理?这些问题,存文档这个动作本身回答不了。
说白了,现在大多数个人知识库做的是"收纳",不是"学习"。你往里塞东西,它就帮你放着。至于这些东西之间有什么规律、能总结出什么经验、下次怎么用——全靠你自己脑子里记着。
脑子的容量是有限的,记不住的东西就白存了。
企业知识库比个人知识库成熟一些。很多做得好的企业知识库,不是把文档堆在一起,而是分层管理。大概这么四层:
第一层,原始资料。 就是各种文档、记录、素材,原样存放。这一层个人知识库也有,没什么差别。
第二层,概念知识。 把零散的资料里涉及的人名、项目名、术语这些实体提取出来,建立词条。查一个词,能看到它出现在哪些文档里。这一层有些个人工具也做了,比如Obsidian的链接和标签。
第三层,业务规律。 这是企业知识库比个人强的地方。比如某类工作怎么干、标准流程是什么、容易在哪出问题、有什么注意事项——这些是从大量实际工作中总结出来的,不是某个文档原文,而是从很多文档里提炼的。
第四层,通用方法。 再往上抽象,就是方法论层面的东西了。PDCA循环、持续改进这些,适用于很多不同类型的工作。
个人知识库一般做到了第一层和第二层就停了。差就差在第三层——没有把做过的事总结成规律。
道理好懂,但真要做的时候有个问题:规律不是你想总结就能总结出来的。
你拿一篇文档说"我要从你身上总结规律",大概率总结不出什么。一篇文档信息太少了。
但如果我有五十多篇同类文档呢?
我之前写报告,每次都存了初稿到定稿的全过程版本。不知不觉攒了几十组。有一天我突然想,如果把这些版本两两对比,看每次都改了什么,改得最多的地方不就是最容易出错的地方吗?
这个思路说白了就是:
一篇文档,看不出规律多篇文档放一起,重复的东西就冒出来了重复得越多,说明越重要不用预设"我要找什么规律",你把材料堆在一起对比,出现次数最多的东西,自然就是规律。这比坐在那想"我有什么经验"靠谱多了,因为你的记忆会骗你,但文档不会。
光说不练假把式。我们用上面的思路,实际做了一件事——从历史文档里自动学习校稿规律,最后形成了一个能用的校稿工具。
我手头有53组工作文档的版本迭代。每组都是从初稿到定稿的多个版本。这些文件以前就是存着的,从来没仔细看过。
用WorkBuddy写了几个脚本,把每组的初稿和定稿做句子级别的对比(diff),看修改了哪些地方。然后把所有修改分类统计:
错别字方面: 从53组对比中,提取出了20个高频错别字。排第一的是数字写错——比如"第四次会议"应该是"第五次会议",这个错误出现了175次。排第二的是条文编号写错,出现了40次。这些都是人工校稿容易漏的。
润色用词方面: 提取出15种高频修改模式。比如引用法律法规时应该用"根据",引用内部制度时用"按照",引用具体条款时用"依据"——这三种用法以前我混着用,改了31次、21次、14次才记住。
格式结构方面: 发现标题层级基本固定是一、→(一)→1.→(1),但偶尔会少一层或多一层。
风格方面: 从633篇文档中统计出风格画像——平均句长66字,中文标点占比72.8%,每篇平均78个数字,以报告体为主。
上面这些统计结果,不是看完就完了。我把它们整理成了一份规则卡,直接喂给AI模型用。
规则卡里包含:
20条自学习的错别字对照表(附带出现次数和上下文示例)15条润色用词规律(根据/按照/依据/遵照四个层级的用法)风格画像(句长、标点比例、数字密度)给模型的指令模板实际用法很简单——把这份规则卡贴到Obsidian Copilot的Custom Prompt里,或者喂给命令行校稿工具。之后每次校稿,AI就按这些从你自己的文档里学到的规则来检查,而不是用通用规则。
效果很明显。以前校稿就是通读一遍,靠眼力挑错,经常漏。现在AI按你的高频错误清单逐条查,175次出现的那个错别字再也不会漏了。而且这些规则是从你自己写的东西里提取的,比通用校稿工具更贴合你的实际写作习惯。
回过头看,整个过程其实就四步:
有素材(53组版本文件)做对比(初稿和定稿diff)统计频率(哪些修改反复出现)固化成规则(整理成规则卡,喂给AI)这里面,素材是以前就存着的。变化在于——不只是存着了,而是拿来做对比统计,最后形成了能用的东西。
这就是从"资料库"到"知识库"的过程。 规律不是凭空总结的,是从大量实际材料里对比出来的。出现频率高的,就是规律。形成规则卡之后,它就能指导未来工作——下次校稿直接用。
如果每个工作类型都能这样总结出一份规则卡,那知识库就真的活起来了。
本文记录的是实际操作过程,规则卡数据来自53组真实文档版本对比。