最近两个月,「个人知识库」这个圈子难得地热闹了起来。
导火索是 Karpathy(OpenAI 创始团队成员、前特斯拉 AI 负责人)4 月初发的一篇长帖。他说自己现在大部分 token 消耗不再是写代码,而是"处理知识"——用 LLM 把各种原始资料增量式地"编译"成一套 Markdown Wiki,Obsidian 只拿来当查看器。知乎这篇帖子在知乎衍生出一个 29 万+浏览的讨论帖,7 月到 8 月,跟进实践、晒方案的文章一波接一波:「Codex+Obsidian,打造会自增长的知识库」「基于 Obsidian+Claude Code 的个人知识库构建」拿了五百多个赞。知乎
但更有意思的是,吹捧的同时,反对派的声音一样大。有人直接写「别搞 AI 个人知识库了,真的没用」,说 95% 的人最后建了个"数字版废品收购站";有人在 Karpathy 的帖子底下泼冷水,说这是"企业 Wiki 项目的限时返场",是拿 token 烧钱换一个只适合少数博主的工具。知乎知乎
我把两派的帖子、回答、评论都翻了一遍,今天不聊工具选型,先聊一个被这场争论照出来的根本问题:你的知识库,到底是给谁用的?
一、先说清楚 Karpathy 到底在干嘛
很多教程只转述了个大概,这里把他的原始流程拆完整:
数据摄入:原始资料(文章、论文、代码库、图片)全部索引进一个 raw/ 目录,网页用 Obsidian Web Clipper 转成 .md 存本地;
LLM 编译:让 LLM 增量式地把 raw/ "编译"成一套 Wiki——一堆 .md 文件,包含摘要、反向链接、概念归类,还会自动撰写关联文章;
前端查看:Obsidian 只是"前端 IDE",用来看原始数据、编译后的 Wiki 和生成的可视化图表。注意他的原话:Wiki 全部由 LLM 编写和维护,“我很少直接改动它”;
问答:Wiki 规模够大之后(他举例:某个研究主题的 Wiki 约 100 篇文章、共 40 万字),直接向 LLM 提复杂问题,让它自己检索、研究、作答。他说原以为要上复杂的 RAG,结果这个规模下 LLM 自己维护索引文件就够用了;
回流:输出的 Markdown、幻灯片、图表再"归档"回 Wiki,“我自己的探索和查询总是在为知识库增值”;
健康检查:定期让 LLM 跑 Linting——查矛盾数据、补缺失信息、发现新关联。知乎
思路源头是 1945 年 Vannevar Bush 提出的 Memex——一台用"联想迹线"而非分类目录组织知识的假想设备。知乎八十年来所有笔记软件都在试图实现它,但都把"建立关联"的体力活推给了用户。Karpathy 的版本等于说:这个活,让 LLM 干。

二、实践派:知识库的第一读者,已经换成 AI 了
为什么有人对这套方案上头?看一个真实案例就懂了。
知乎上有个 3.7 万浏览的回答,作者照这个思路搭了一个多月,结论是"我根本不是这个知识库的目标用户,AI 才是"。知乎他以前在微信收藏、备忘录、Obsidian 攒了几百条笔记,“记完就再也没打开过,不是懒,是根本想不起来去翻”。现在他写文章要查"上次本地 OCR 怎么部署的",直接问 AI,AI 从知识库把教程翻出来递给他。
他还做了个细节改造:给知识条目加置信度标注——实操验证过的标"高",单一来源标"中",论坛观点标"低",AI 调用时优先信高置信度内容。知乎用他的话说:没有知识库的 AI 像个没有长期记忆的人,“每次都要从头解释我的 NAS 是什么型号、代理端口是多少,同一个坑踩十次”。
另一个 7 月底的讨论帖说得更直白:知识库的受众不再是人,而是 Agent。 你脑子里浮现的"随时翻阅的第二大脑"已经过时了,新的图景是:你往库里存的东西,是给 AI 准备的上下文和长期记忆。知乎
在这批实践者里走得更远的,已经开始把"方法论"沉淀成 AI 可执行、可版本管理的 skill 文件——有位博主的每日复盘 skill 迭代到了 v3.7,写作 skill 迭代到 v4.0。知乎知识库从"存资料"进化成了"存可复用的经验"。

三、反对派:这笔账必须算给你看
但质疑派给的成本核算,同样值得认真看。
知乎那条 283 赞的高赞反对回答,核心是三条:
token 账单:不用 Embedding 索引、全靠 LLM 增量维护,token 消耗随文档量至少线性增长。而 Embedding 模型的单价只有 LLM token 的几分之一甚至更低,用 LLM 去维护知识库,相当于"用光刻机的零件拼珍妮纺纱机";
老病没治:从 Evernote 到 Notion 到 Obsidian,知识库的死穴从来不是"结构不够好",而是分类和关联拉到长期一定会失效——不管维护者是人还是 LLM;
受众太窄:这套方案"极大增加管理维护复杂度,只适用于一小撮播客或自媒体博主"。这位答主自己常用的反而是 NotebookLM 和 ima:一个把格式转换压榨到极致(音视频、PPT、脑图、文档互转),一个直接往里丢文件、装个浏览器插件采集网页,然后提问就行。知乎

另一位更扎心:他观察身边搭 AI 知识库的人,大多数结局是"数字版废品收购站"——需要查东西时不如直接问 AI,做决策时库里那些"金句"一条都想不起来。知乎这个数字是个人观察,谈不上严谨统计,但它戳中的痛点是真实的:「收藏→整理→打标签→以备调用」这条路,从印象笔记时代起就反复被证明走不通。
连实践派自己也承认这一点。有位做 Obsidian+Claude Code 全记录方案的作者,把公式写成了"仓库思维 vs 加工厂思维":仓库是"觉得以后用得上就存进去",只进不出,越堆越乱;加工厂是"原料进来→分类→加工→输出成品→清理废料"。知乎他给自己定的规矩是:不按天记流水账,只记"明天还能用"的东西,一周只有 2-3 条值得入库,才是健康状态。
四、争论的本质:不是工具之战,是"读者"换代
看完两派所有帖子,我的判断是:他们吵的根本不是 Obsidian 还是 NotebookLM,而是一次用户定义的变更。
过去二十年的知识库,默认假设都是"人会翻"——所以你要分类、打标签、建双链,所有负担压在用户身上,最后 99% 的人败给了"想不起来翻"。Karpathy 的方案第一次把假设换掉了:翻知识库的是 AI,人只负责喂原料和提问。知乎
实践派在为这个新范式投票:知识库存下来不是给我看的,是给 AI 调用的,所以"找不到"的问题被 AI 解决了,"懒得整理"的问题也被 AI 解决了;
反对派在质疑这个新范式的成本:token 要钱,数据清洗的脏活还是得自己干,而且"编译"本身才是最难的部分——知识不内化,AI 怎么调用都是垃圾进垃圾出。
有意思的是,两派有一条难得的共识:死掉的都是仓库。 无论你走哪条路线,只存不用、存了不加工的知识库,结局都是废品收购站。AI 没有改变这一点,只是把审判来得更快了。
五、你该走哪条路:对号入座
结合社区实践和两派的论据,给三类人三个建议:
第一类:你的"知识库"只是收藏夹——别搭了。 如果你的状态是"先存起来以后可能用得上",搭知识库只会制造更大的心理负担。需要信息时直接问 AI、直接搜索,比翻自己三个月前存的摘要快得多。知乎承认自己不需要知识库,比硬搭一个省事。
第二类:有明确的资料查询场景——用托管型产品。 比如要处理论文、行业报告、工作文档、会议纪要的人,NotebookLM、ima、Get 笔记这类产品是正解:丢文件进去直接提问,零维护、多端同步,不用碰任何目录结构。代价是功能限制(比如 ima 被用户吐槽一次只能导入 10 条链接)和数据在云端——介意隐私的慎选。
第三类:每天都重度用 AI、愿意动手——才考虑本地方案。 Obsidian + Claude Code/Codex 是当前社区主流组合,适合程序员、写作者、内容创作者。知乎但社区实践者共识的三条规矩,建议照抄:① 只记"明天还能用"的,一周两三条是健康值;② 用自己的话重述后再入库,带上条件和结论,摘抄原文不算知识;③ 给条目标置信度,验证过的和道听途说的分开存。做不到这三条,本地方案只会更快变成废品站。

最后说个值得蹲的信号:Karpathy 在原帖结尾写了一句——“我认为这里有巨大的空间去打造一款令人惊叹的新产品,而不仅仅是一堆简陋的脚本集合”。知乎换句话说,连他自己都承认现在的玩法还是极客手工活。接下来一年,笔记产品大概率会跟进"AI 自动维护"这个方向,届时第二类人和第三类人的边界会被重新画一遍。
搭知识库之前,先回答一个问题:这个知识库,谁会调用它?在什么场景调用? 答不上来,你存的不是知识,是焦虑。