这几天刷小红书,你大概率会刷到"Obsidian+AI 第二大脑"的保姆级教程,从仓库搭建到双向链接,各种方法论模板都被人做成了现成卡片小红书。这股火的源头在 4 月 2 日:Karpathy(前特斯拉 AI 总监、前 OpenAI 创始成员)发了一条用 LLM 搭个人知识库的帖子,阅读量冲到上千万,顺手放出的 GitHub Gist 拿到 5000 多 Star,评论区长出 20 多个衍生项目知乎知乎。

4 个月过去,对还在观望的你来说,现在反而是做决定的最好时机:尝鲜的人把坑踩完了,真实成本有人实测了,连省 token 的优化方案都迭代出结果了。今天把社区这 4 个月的公测结论整理成一份清单,你对照自己的情况看就行。
Karpathy 的"LLM Wiki"到底是什么
一句话:别让 AI 每次回答问题都从零检索,而是让它把你丢进去的资料"编译"成一套互相链接的 Markdown 维基,之后由 AI 持续维护这套维基。
结构分三层:
raw/:原始资料(论文、文章、网页),只进不改;
Wiki:LLM 读完后编译出的 .md 页面,含摘要、反向链接、概念归类——这一层全由 AI 写,人基本不碰;
Schema:规则文件(如 CLAUDE.md),告诉 AI 怎么组织、什么不能做。

操作就三个:Ingest(丢新资料进去,AI 读完更新 wiki)、Query(直接对 wiki 提问)、Lint(定期体检,查矛盾、过期内容和缺失链接)。Karpathy 自己说,他的一个研究 wiki 已有约 100 篇文章、共 40 万字,可以直接对它提各种复杂问题,让 LLM 自动研究、找答案知乎。前端他直接用 Obsidian 浏览。他还特意强调这只是"idea file",不是成品实现——这也解释了后来 4 个月里为什么会长出各种实现版本和争论。
社区 4 个月验证出的三件事
第一件:真能干活,不是演示玩具。知乎用户"卡卡带我飞"自己搭了套类似系统(多 Agent+Obsidian)跑了好几个月,他说最实在的场景是写周报:每个 Agent 每天记流水账,周末让 AI 直接汇编成周报初稿,“以前写周报翻各种记录凑内容,一两个小时打底。现在5分钟出初稿”知乎。另一位用户 Erber 把它和苏格拉底问答法结合用来期末复习,连期中错题都喂进库里知乎。这篇实践帖在知乎拿到 565 赞、1800 多收藏。

第二件:维护成本没有消失,只是从"手动整理笔记"变成了"写规则+管预算"。这是 4 个月里最大的认知差。很多人以为"AI 维护"等于躺平,实际上卡卡带我飞的规则文件迭代了至少 5 个版本,第一版只有 200 字、只写了个大致流程知乎。后来的版本一路膨胀到几百行——规则写不清,AI 就会到处踩雷、把 A 任务的流程用到 B 任务上。也就是说,整理成本前置到了 Schema 设计里。指望一键自动生成的人,大概率三周废弃:Erber 自己第一版让 AI 重构笔记的方案,跑了几周就维护不动、直接弃坑了。
第三件:token 爆炸有明确根因,也已经有成熟解法。这是和钱包最相关的部分。用户 sudden 做了实测:13 篇英文论文入库,初始构建消耗约 300 万 token;再新增 6 篇,更新消耗比初始构建还高。根因是"递归合成"——收集资料触发的更新量会随 wiki 总页面数指数增长,复杂度直接冲到 O(N³)知乎。解法同样明确:入库只做轻量处理,跨文档综合推迟到你提问时按需触发,反向链接不实时维护,冲突检测改成批量体检。优化后,新增一篇论文的更新消耗从 326 万 token 降到 42 万,约为原来的八分之一。
要花多少钱:社区实测的参考账
下面是社区实测出来的数字,不是官方价目表,量级比绝对值更值得参考:
项目 | 社区实测参考 |
|---|---|
小型垂直库初始构建(13 篇论文) | 约 300 万 token,赶上国产模型折扣时约 2.3 元 |
按优化规则设计后 | 单次更新消耗约降 87% |
国产模型 API 日常跑 | 有重度多 Agent 用户报 300-500 元/月 |
DeepSeek V4 Pro(5 月折扣价) | 输入 3 元/百万 token,缓存命中低至 2 分 |
两点提醒:一是这是 5 月大促时的价格,现在的实际账单以你下单时的价格为准;二是如果你用订阅制商用模型,成本就体现在订阅档位上,"入库+体检"越频繁,额度烧得越快,重度用户往往需要更高一档的订阅。
这份坑清单,是社区真摔出来的
中文与国产模型的坑。中文 Markdown 的双向链接 [[]] 在不同模型里表现不一样,有的模型偶尔会把 [[]] 当成特殊 token 吃掉,链接直接断掉知乎。国产模型处理长文档的能力与头部商用模型还有差距,同一套规则出来的 wiki 质量更低。用国产模型可以,但要预留调规则的时间。
AI 写坏文件的坑。Agent 有概率把文件覆盖写坏,而且这种损坏比"内容写错"致命得多——内容错了最多答错,文件坏了整个库打不开。社区的标准解法:知识库放进 Git,每次写入自动 commit,出问题一行命令回滚。没做备份就开工,等于裸奔。
知识投毒的坑。自动摄入外部内容时,恶意文档可能夹带指令,一旦被写进 wiki,会持续污染后续所有回答——间接提示注入已被 OWASP 列入大模型风险清单。个人知识库建议只喂自己看过的资料,全自动 RSS 摄入要谨慎。
摄入顺序偏见的坑。来源超过 50 个时,先进库的内容会系统性带偏整个 wiki——AI 处理第 30 篇时倾向跟前面已编译的内容保持一致,哪怕新资料更准确。解决办法:打乱顺序摄入、定期批量体检。
规模错配的坑。社区里有个很实用的量级判断:个人知识库整理完通常在几千到 2 万 token,现代模型的上下文窗口完全装得下,这套方案比"先检索再回答"的 RAG 方案更稳;但资料到了百万 token 级(几千页文档),老老实实上 RAG,LLM Wiki 只适合做预处理。

反方的声音,也值得听
知乎上 283 赞的质疑回答说得挺狠:这是一个"极大增加了管理维护复杂度,极大程度上增加token消耗,同时只适用于一小撮播客或者自媒体博主"的知识管理方案知乎。剥掉 Agent 外衣,本质就是多年前企业内部 Wiki 项目的限时返场。答主自己的替代方案倒很务实:资料直接丢进 NotebookLM、ima 这类产品,问就完了,几乎零维护。
两派其实都没错,分歧点在于:你是否对一批资料有高频、深度的提问需求。有的话——写论文、做研究、长期深耕一个领域、持续输出内容——一个越用越聪明的库值得投入;如果你的需求只是"先收藏起来,以后也许要搜",那 RAG 类产品确实更省力,别为了折腾工具而折腾。
到底上不上车:对照这份清单
建议上车,三条同时满足:
某个领域已经积累了几十份以上资料,且会持续新增;
有高频提问或输出需求,不只是囤积;
愿意花一两个周末写规则、做迭代,不指望一键搞定。
先别上车,命中任意一条:
全部资料就是几十个收藏夹链接——你的问题不是工具,是没开始动手;
期待"AI 全自动打理",不想碰终端和规则文件;
没有也不打算为 AI 订阅或 API 付费。
决定上车的话,按成本从低到高有三条路:
本地免费路线:Synto 这类开源项目支持 Ollama、LM Studio 跑本地模型,API 零成本,适合先验证自己能不能坚持;
国产模型低价路线:接 DeepSeek 这类打折 API,配上社区优化过的规则模板,初始构建成本以元计;
商用模型订阅路线:本来就有 Claude 等订阅的,直接用 claude-obsidian(5800 多 Star)或 llm-wiki-compiler 这类现成开源实现,省掉从零搭建的工夫知乎。
无论选哪条,都建议从一个小主题起步——先喂 10 到 20 份资料,把"入库、提问、体检"跑顺了再扩。上来就把几年的笔记全量迁移,是最常见的放弃方式。如果你的场景是备考或系统学一门学科,社区也有现成玩法:把"记笔记"和"背闪卡"合进 Obsidian——Markdown 写完的瞬间闪卡就自动做好了,复习时还能全库随机抽认,不用自己翻库小红书。

接下来值得盯的三个信号
Karpathy 今年 5 月已正式加入 Anthropic,此后他在开源社区的活跃程度直线降低知乎。这套思路会不会产品化,决定它是停留在极客玩具还是变成大众工具。
国产模型 Markdown 处理和长文档能力的迭代速度。社区判断是"再过半年,差距可能基本抹平"。
Obsidian 官方和插件生态的跟进。本周小红书的教程潮说明大众化已经在发生。
最后一句:AI 知识库不会消灭维护成本,它只是把付费方式从"每天手动整理"换成"一次写好规则、偶尔看看账单"。想清楚你要什么、愿意付什么,再动手,比抄作业重要得多。