7 月初的时候,我照着 Karpathy 那套 LLM Wiki(简单说就是让 AI 帮你把资料编译成一个能长大的百科)搭了个本地知识库。
建完不到一个小时,我把目录改了两次。第 12 天,我把整个库拆了一遍。
最近这类文章挺多的,我基本都看了一遍,讲得都挺好。但看完我发现一个问题,它们全都停在「搭起来那一刻」。有的库还是空的,有的只塞了 3 条收藏,有的干脆连 AI 都没接。
没人告诉我,搭完之后的第 10 天、第 20 天,这东西会变成什么样。
我这个库现在跑了 27 天,273 篇笔记,有一份完整的维护日志,记着每一次改动和每一次翻车。
所以搭建部分我压到最短,这篇主要讲搭完之后会发生什么,以及怎么让它别烂掉。
可能有人会问,费这劲搭它干嘛。
我自己有两个挺实在的理由。

第一是东西能找回来。以前看到好文章就往收藏夹一存,存完再也没打开过。现在不一样,我写这篇的时候顺口问了句「我之前收过哪些关于知识库的资料」,它自己就翻出来了,连我当时是怎么判断的都在。
第二个理由更重要,你沉淀下来的方法论,本身就是产品。
我这库里现在有 23 篇方法论,全是从看过的文章和自己踩过的坑里一点点抠出来的。它们现在是我写文章、做判断的依据,往后想做成课程、专栏还是别的什么,材料都是现成的。
内容本身会过期,但你从内容里提炼出来的判断标准不会。
明白这两点,下面这些折腾才值得。
对了,我一个插件都没装。

我的知识库目录
先说搭建。
你只需要两个东西,Obsidian 和 Codex。分工很简单,Obsidian 只负责看和写,真正整理知识的是 Codex。你要是习惯 Claude Code,换成 Claude Code 一样,这套东西不挑用哪个 AI。
然后是建目录。这一步卡住的人不少,有人就问了「把目录层级设置为如下结构,这一步就不知道怎么弄了」。其实就是在 Obsidian 里手动新建几个文件夹,跟你平时在电脑上建文件夹没区别。
我是这么分的。01_个人 到 05_方法论 放整理好的内容,资料直接进这里;99_待整理 是兜底区,只放没想好归属和处理失败的;AGENTS.md 加 00_系统 是规则层,告诉 AI 怎么干活;根目录再放一个 index.md 当总索引,一个 log.md 记维护日志。
这里有两个地方,我跟其他文章的做法不一样。
第一个,我没建 raw 目录。
Karpathy 原方案是 raw 和 wiki 两层,原文先剪藏进 raw,再让 AI 编译进 wiki。有个读者的吐槽说到点子上了:「使用 raw 这种结构对初上手会有点重,因为每次从别的项目沉淀的内容进入到 raw 都要判断一下属于哪个分支。」
我把存原文这一步直接省掉了。 链接扔给 Codex,它读完直接整理进对应位置,一步到位。兜底区不是必经之路,它只接住漏网的东西。
第二个,我按生活维度分,不按资料类型分。个人、每日记录、内容与自媒体、产品与项目、方法论。
因为 raw 加 wiki 那套是给「资料库」用的,你要查的时候去翻它。而我要的是一个能替我干活的库,AI 干活时要读的是「我是谁」和「我的判断标准」,不是「我剪藏过哪些网页」。
接下来是我最想安利的一步,资料怎么进库。
Karpathy 原帖里写得很清楚,他用 Obsidian Web Clipper 这个浏览器插件把网页转成 md。我看的那几篇文章,也都照着教了一遍怎么装这个插件。

Karpathy 的原帖,他用 Web Clipper 转 md
但那是资料入库还得靠人剪的时候。现在的 agent 自己就能读链接,这一步可以省掉了。
我的实际操作是,看到一篇好文章,把链接甩给 Codex,加一句「收了」。
完事。

一个链接加一句话,它自己整理好了
它读完原文,提炼要点,判断归到哪个目录,写进对应页面,更新索引,最后在日志里记一笔。这一次它动了 5 个文件,加了 258 行。整个过程我没做任何判断,也没打开过 Obsidian。
更关键的是截图里这句:「多站指网站,不是多个公众号,因此 AI 产品普洱 继续保持单公众号做深」。
那篇文章讲的是一个人做几百个站的打法,跟我「先做深一个号」的策略是冲突的。它没有偷偷把我的策略改掉,而是把冲突单独标了出来。 这条规则怎么来的,后面细说。
有个坑得提前讲,公众号链接经常直接读不到。遇到这种情况,让 Codex 用浏览器打开那篇文章就行,一句话的事。
目录和工具都是壳子,真正让这套东西转起来的是 AGENTS.md。
上次分享,看到好几个人在追问「AGENTS.md 提示词有完整文档吗」,我把我这份完整放公众号里了,公众号回复 agent 领取,需要的自取。

我的 AGENTS.md
里面最关键的两条:新内容必须先和已有内容做冲突检查,不得只因为新资料看起来更完整就覆盖旧口径;更新重要页面后同步 index.md,整理完在 log.md 追加记录。
第二条看着最琐碎,但没有它,你根本不知道这个库这一个月发生过什么。
铺垫完了,下面是我最想讲的部分。
搭完两周,这个库开始出问题了。
一个方法论页面涨到了 568 行,长到我自己都不想点开。另一个只有 10 行,孤零零挂着。还有一个页面里塞了两件完全不相关的事,健康作息和商业判断混在一起。另外两条每日记录的链接,点开是空的。
7 月 18 号,我做了一次大手术。

7 月 18 号那次内容体检
568 行那个收敛成总入口,拆出三个能独立复用的页面;10 行的碎片页合并进两个相关页面,原页删掉;混着两个主题的拆成两半各自归位,断链修好。
拆完我总结了四条判断标准,你可以直接抄。
页面超过 300 行,收敛成入口页,把能独立复用的拆出去。长期不到 20 行,合并进相关页面,别单独留着。一个页面在讲两件事,拆开各自归位。链接点开是空的,要么补页面,要么删链接。
然后就是转折了。
拆完那次,我以为干净了。
前两天我让 AI 把全库扫了一遍。
还有 218 个页面是孤立的,占全库 80%,没有任何页面链接进来,它自己也没链出去。
这个我得说实话,里面一大半是我早期图省事,把以前的收藏整个复制进来的。复制只要几秒钟,但 AI 没帮它们建立任何联系,它们就是一堆躺在硬盘上的文件。
这张是我的关系图谱。

关系图谱
看着挺热闹,但你现在知道了,那 218 个孤立页根本不在这张图上。
存进去,不等于进了知识库。
于是我设了两个定时任务。
这事 Karpathy 其实提过。他原帖里专门有一段叫 Linting,说他跑过一些 health checks 来找库里前后矛盾的数据,逐步清理 wiki,但他没说怎么让它自动跑。
我做的就是在 Codex 里把它挂成定时任务。

两个定时任务
第一个是每周知识库体检,周日晚 9 点跑,扫全库找四类病:页面超长、页面过短、主题混杂、链接失效。上面那些问题就是它翻出来的。这个任务只出报告,不动手改,为什么等下说。
第二个是每天整理一次 inbox,晚 10 点跑。
我的 inbox 就是前面说的兜底区。资料平时都是扔链接直接整理进去的,这个区本来就该是空的。但总有漏网的,这些东西一旦掉进去就再也没人管了。
所以这个任务专门盯着它,上次抓取失败的这次先用浏览器打开再试一遍。没东西就直接报「今日无待整理内容」,不许为了显得有产出去动别的页面。
有个前提必须提醒你,官方文档里明确写着的。

官方文档里这句很关键
定时任务要读写你电脑上的本地文件,所以到点的时候电脑得开着,app 也得开着,关机或者退出了它就不会跑。我把两个任务都排在晚上,就是因为那会儿电脑还开着。
这条要是不知道,你设完第二天发现没动静,多半会以为方法是假的。
回到刚才那个问题,为什么体检只出报告不动手。
因为它判断不了哪些该删。 它能列出 218 个孤立页,但哪些该接进导航、哪些本来就该躺在归档里,这个它分不清。
所以我在体检任务里加了条硬约束,不许修改、拆分、合并、删除任何页面,也不许动 index.md 和 log.md。
还有个问题,问的人不少:「怎么解决 AI 幻觉?会不会把知识库里的 A 和 B 合成一个 C 出来,而 C 根本不存在?」
我遇到的情况比这更常见,也更隐蔽。它不编,它漏。
7 月 28 号,我让 AI 整理一篇讲程序化 SEO 的长文,生成的页面看起来相当完整,条理清楚。我拿原文对了一遍,发现老域名的实操入口全没了,几个交易平台一个都没提。补完再对一次,还漏了挖词阈值和成本表。
最后是按原文 15 个步骤标题、10 张表格做了一次完整覆盖审计,才算补齐。

两次复核才补齐的记录
为什么会漏?因为 AI 提炼时会把它认为「有风险」「太琐碎」的东西删掉,而且删得很安静,不会告诉你它删了什么。而价格、数量、阈值这类信息,恰恰最有用,也最容易被当成琐碎。
我后来往规则里加了两条,你可以直接抄。
第一条防漏,叫来源覆盖检查。 对照原文每个章节、每张表格建一份清单,每项标记成「已吸收」「作为外部参数保留」或「未收录并说明原因」。价格、数量、阈值逐项核对,不能只看大标题出现过就算数。
第二条防覆盖。 写入新内容前先搜同主题的旧页面,发现方向、数量、策略上有冲突,必须把冲突说明保留下来,明确区分「当前确认口径」「外部资料观点」和「待确认问题」。
前面那个「多站指网站,不是多个公众号」,就是这条规则的产物。
这也顺便回答了另一位读者的困惑:「我一直投喂那些看起来很有道理的知识,但我判断不了这些知识,怎么办。」答案是别让 AI 替你判断,让它把冲突摆到你面前。
最后说一条我觉得最实在的建议,前期收录的内容,最好自己都读一遍 AI 整理出来的东西。
倒不是不信任它,是你得先知道它习惯漏什么。看过十几篇你才会发现规律,它总是滤掉阈值、价格、具体平台名,总是把带点风险的操作步骤悄悄删掉。
摸清了规律,你才知道该往规则文件里补哪几条约束。我上面那两条就是这么被逼出来的,不是一开始想到的。
这个阶段跳不过去。 规则没打磨好就撒手不管,等你发现整理质量有问题,错误早写进几十个页面了,返工比一开始核对贵得多。稳定之后再交给定时任务,这才是能放手的顺序。
最后回答几个问得最多的问题。
要装哪些插件? 一个都不用装。资料入库靠扔链接,双链就是 [[页面名]] 这个纯文本,AI 直接写进 md 就生效。而且插件多了不稳定,还会让笔记依赖某个软件,将来不好迁移。
为什么不直接用那些现成的知识库产品? 那类产品的库是给它自己用的,我这个库要给任何一个 agent 读了就能干活。
手机上怎么看?我的知识库文件夹放在 iCloud 里,手机端 Obsidian 直接打开就行。也有读者用 NAS,一样可以。
数据安全吗,换软件会不会被锁死? 文件全在自己硬盘上,而且全是纯 markdown。官方文档写得很明白,你可以用任何文本编辑器直接改,Obsidian 会自动刷新。

Obsidian 官方文档
这也正是 AI 改完文件、Obsidian 里立刻就能看到的原理。
搭一个本地知识库真的 20 分钟就够了,这是整件事里最容易的部分。
剩下的 27 天才是它真正的样子。 会长歪,会积灰,会在你没注意的地方断掉一条链接,然后你 27 天都发现不了。
所以别把力气全花在搭建上。搭一个最简单的,赶紧用起来,然后把维护交给定时任务,把判断留给自己。
文章来自于"AI产品普洱",作者 "AI产品普洱"。
【开源免费】AIEditor.dev是一个开箱即用、并且支持所有前端框架、支持 Markdown 书写模式的AI富文本编辑器。
项目地址:https://github.com/aieditor-team/AiEditor?tab=readme-ov-file
【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。
项目地址:https://github.com/Significant-Gravitas/AutoGPT
【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。
项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md
【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。
项目地址:https://github.com/labring/FastGPT
【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。
项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md
在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0