Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录
6089点击    2026-08-03 15:53

7 月初的时候,我照着 Karpathy 那套 LLM Wiki(简单说就是让 AI 帮你把资料编译成一个能长大的百科)搭了个本地知识库。


建完不到一个小时,我把目录改了两次。第 12 天,我把整个库拆了一遍。


最近这类文章挺多的,我基本都看了一遍,讲得都挺好。但看完我发现一个问题,它们全都停在「搭起来那一刻」。有的库还是空的,有的只塞了 3 条收藏,有的干脆连 AI 都没接。


没人告诉我,搭完之后的第 10 天、第 20 天,这东西会变成什么样。


我这个库现在跑了 27 天,273 篇笔记,有一份完整的维护日志,记着每一次改动和每一次翻车。


所以搭建部分我压到最短,这篇主要讲搭完之后会发生什么,以及怎么让它别烂掉


可能有人会问,费这劲搭它干嘛。


我自己有两个挺实在的理由。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录


第一是东西能找回来。以前看到好文章就往收藏夹一存,存完再也没打开过。现在不一样,我写这篇的时候顺口问了句「我之前收过哪些关于知识库的资料」,它自己就翻出来了,连我当时是怎么判断的都在。


第二个理由更重要,你沉淀下来的方法论,本身就是产品


我这库里现在有 23 篇方法论,全是从看过的文章和自己踩过的坑里一点点抠出来的。它们现在是我写文章、做判断的依据,往后想做成课程、专栏还是别的什么,材料都是现成的。


内容本身会过期,但你从内容里提炼出来的判断标准不会。


明白这两点,下面这些折腾才值得。


对了,我一个插件都没装。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

我的知识库目录


先说搭建。


你只需要两个东西,Obsidian 和 Codex。分工很简单,Obsidian 只负责看和写,真正整理知识的是 Codex。你要是习惯 Claude Code,换成 Claude Code 一样,这套东西不挑用哪个 AI。


然后是建目录。这一步卡住的人不少,有人就问了「把目录层级设置为如下结构,这一步就不知道怎么弄了」。其实就是在 Obsidian 里手动新建几个文件夹,跟你平时在电脑上建文件夹没区别。


我是这么分的。01_个人 到 05_方法论 放整理好的内容,资料直接进这里;99_待整理 是兜底区,只放没想好归属和处理失败的;AGENTS.md 加 00_系统 是规则层,告诉 AI 怎么干活;根目录再放一个 index.md 当总索引,一个 log.md 记维护日志。


这里有两个地方,我跟其他文章的做法不一样。


第一个,我没建 raw 目录


Karpathy 原方案是 raw 和 wiki 两层,原文先剪藏进 raw,再让 AI 编译进 wiki。有个读者的吐槽说到点子上了:「使用 raw 这种结构对初上手会有点重,因为每次从别的项目沉淀的内容进入到 raw 都要判断一下属于哪个分支。」


我把存原文这一步直接省掉了。 链接扔给 Codex,它读完直接整理进对应位置,一步到位。兜底区不是必经之路,它只接住漏网的东西。


第二个,我按生活维度分,不按资料类型分。个人、每日记录、内容与自媒体、产品与项目、方法论。


因为 raw 加 wiki 那套是给「资料库」用的,你要查的时候去翻它。而我要的是一个能替我干活的库,AI 干活时要读的是「我是谁」和「我的判断标准」,不是「我剪藏过哪些网页」。


接下来是我最想安利的一步,资料怎么进库。


Karpathy 原帖里写得很清楚,他用 Obsidian Web Clipper 这个浏览器插件把网页转成 md。我看的那几篇文章,也都照着教了一遍怎么装这个插件。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

Karpathy 的原帖,他用 Web Clipper 转 md


但那是资料入库还得靠人剪的时候。现在的 agent 自己就能读链接,这一步可以省掉了。


我的实际操作是,看到一篇好文章,把链接甩给 Codex,加一句「收了」。


完事。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

一个链接加一句话,它自己整理好了


它读完原文,提炼要点,判断归到哪个目录,写进对应页面,更新索引,最后在日志里记一笔。这一次它动了 5 个文件,加了 258 行。整个过程我没做任何判断,也没打开过 Obsidian。


更关键的是截图里这句:「多站指网站,不是多个公众号,因此 AI 产品普洱 继续保持单公众号做深」


那篇文章讲的是一个人做几百个站的打法,跟我「先做深一个号」的策略是冲突的。它没有偷偷把我的策略改掉,而是把冲突单独标了出来。 这条规则怎么来的,后面细说。


有个坑得提前讲,公众号链接经常直接读不到。遇到这种情况,让 Codex 用浏览器打开那篇文章就行,一句话的事。


目录和工具都是壳子,真正让这套东西转起来的是 AGENTS.md


上次分享,看到好几个人在追问「AGENTS.md 提示词有完整文档吗」,我把我这份完整放公众号里了,公众号回复 agent 领取,需要的自取。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

我的 AGENTS.md


里面最关键的两条:新内容必须先和已有内容做冲突检查,不得只因为新资料看起来更完整就覆盖旧口径更新重要页面后同步 index.md,整理完在 log.md 追加记录


第二条看着最琐碎,但没有它,你根本不知道这个库这一个月发生过什么。


铺垫完了,下面是我最想讲的部分。


搭完两周,这个库开始出问题了。


一个方法论页面涨到了 568 行,长到我自己都不想点开。另一个只有 10 行,孤零零挂着。还有一个页面里塞了两件完全不相关的事,健康作息和商业判断混在一起。另外两条每日记录的链接,点开是空的。


7 月 18 号,我做了一次大手术。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

7 月 18 号那次内容体检


568 行那个收敛成总入口,拆出三个能独立复用的页面;10 行的碎片页合并进两个相关页面,原页删掉;混着两个主题的拆成两半各自归位,断链修好。


拆完我总结了四条判断标准,你可以直接抄。


页面超过 300 行,收敛成入口页,把能独立复用的拆出去。长期不到 20 行,合并进相关页面,别单独留着。一个页面在讲两件事,拆开各自归位。链接点开是空的,要么补页面,要么删链接。


然后就是转折了。


拆完那次,我以为干净了。


前两天我让 AI 把全库扫了一遍。


还有 218 个页面是孤立的,占全库 80%,没有任何页面链接进来,它自己也没链出去。


这个我得说实话,里面一大半是我早期图省事,把以前的收藏整个复制进来的。复制只要几秒钟,但 AI 没帮它们建立任何联系,它们就是一堆躺在硬盘上的文件


这张是我的关系图谱。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

关系图谱


看着挺热闹,但你现在知道了,那 218 个孤立页根本不在这张图上


存进去,不等于进了知识库


于是我设了两个定时任务。


这事 Karpathy 其实提过。他原帖里专门有一段叫 Linting,说他跑过一些 health checks 来找库里前后矛盾的数据,逐步清理 wiki,但他没说怎么让它自动跑


我做的就是在 Codex 里把它挂成定时任务。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

两个定时任务


第一个是每周知识库体检,周日晚 9 点跑,扫全库找四类病:页面超长、页面过短、主题混杂、链接失效。上面那些问题就是它翻出来的。这个任务只出报告,不动手改,为什么等下说。


第二个是每天整理一次 inbox,晚 10 点跑。


我的 inbox 就是前面说的兜底区。资料平时都是扔链接直接整理进去的,这个区本来就该是空的。但总有漏网的,这些东西一旦掉进去就再也没人管了


所以这个任务专门盯着它,上次抓取失败的这次先用浏览器打开再试一遍。没东西就直接报「今日无待整理内容」,不许为了显得有产出去动别的页面。


有个前提必须提醒你,官方文档里明确写着的。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

官方文档里这句很关键


定时任务要读写你电脑上的本地文件,所以到点的时候电脑得开着,app 也得开着,关机或者退出了它就不会跑。我把两个任务都排在晚上,就是因为那会儿电脑还开着。


这条要是不知道,你设完第二天发现没动静,多半会以为方法是假的。


回到刚才那个问题,为什么体检只出报告不动手。


因为它判断不了哪些该删。 它能列出 218 个孤立页,但哪些该接进导航、哪些本来就该躺在归档里,这个它分不清。


所以我在体检任务里加了条硬约束,不许修改、拆分、合并、删除任何页面,也不许动 index.md 和 log.md


还有个问题,问的人不少:「怎么解决 AI 幻觉?会不会把知识库里的 A 和 B 合成一个 C 出来,而 C 根本不存在?」


我遇到的情况比这更常见,也更隐蔽。它不编,它漏。


7 月 28 号,我让 AI 整理一篇讲程序化 SEO 的长文,生成的页面看起来相当完整,条理清楚。我拿原文对了一遍,发现老域名的实操入口全没了,几个交易平台一个都没提。补完再对一次,还漏了挖词阈值和成本表


最后是按原文 15 个步骤标题、10 张表格做了一次完整覆盖审计,才算补齐。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

两次复核才补齐的记录


为什么会漏?因为 AI 提炼时会把它认为「有风险」「太琐碎」的东西删掉,而且删得很安静,不会告诉你它删了什么。而价格、数量、阈值这类信息,恰恰最有用,也最容易被当成琐碎


我后来往规则里加了两条,你可以直接抄。


第一条防漏,叫来源覆盖检查。 对照原文每个章节、每张表格建一份清单,每项标记成「已吸收」「作为外部参数保留」或「未收录并说明原因」。价格、数量、阈值逐项核对,不能只看大标题出现过就算数。


第二条防覆盖。 写入新内容前先搜同主题的旧页面,发现方向、数量、策略上有冲突,必须把冲突说明保留下来,明确区分「当前确认口径」「外部资料观点」和「待确认问题」。


前面那个「多站指网站,不是多个公众号」,就是这条规则的产物。


这也顺便回答了另一位读者的困惑:「我一直投喂那些看起来很有道理的知识,但我判断不了这些知识,怎么办。」答案是别让 AI 替你判断,让它把冲突摆到你面前。


最后说一条我觉得最实在的建议,前期收录的内容,最好自己都读一遍 AI 整理出来的东西


倒不是不信任它,是你得先知道它习惯漏什么。看过十几篇你才会发现规律,它总是滤掉阈值、价格、具体平台名,总是把带点风险的操作步骤悄悄删掉。


摸清了规律,你才知道该往规则文件里补哪几条约束。我上面那两条就是这么被逼出来的,不是一开始想到的。


这个阶段跳不过去。 规则没打磨好就撒手不管,等你发现整理质量有问题,错误早写进几十个页面了,返工比一开始核对贵得多。稳定之后再交给定时任务,这才是能放手的顺序


最后回答几个问得最多的问题。


要装哪些插件? 一个都不用装。资料入库靠扔链接,双链就是 [[页面名]] 这个纯文本,AI 直接写进 md 就生效。而且插件多了不稳定,还会让笔记依赖某个软件,将来不好迁移。


为什么不直接用那些现成的知识库产品? 那类产品的库是给它自己用的,我这个库要给任何一个 agent 读了就能干活。


手机上怎么看?我的知识库文件夹放在 iCloud 里,手机端 Obsidian 直接打开就行。也有读者用 NAS,一样可以。


数据安全吗,换软件会不会被锁死? 文件全在自己硬盘上,而且全是纯 markdown。官方文档写得很明白,你可以用任何文本编辑器直接改,Obsidian 会自动刷新。


Codex + Obsidian 搭本地知识库:273 篇笔记 27 天实录

Obsidian 官方文档


这也正是 AI 改完文件、Obsidian 里立刻就能看到的原理。


搭一个本地知识库真的 20 分钟就够了,这是整件事里最容易的部分。


剩下的 27 天才是它真正的样子。 会长歪,会积灰,会在你没注意的地方断掉一条链接,然后你 27 天都发现不了。


所以别把力气全花在搭建上。搭一个最简单的,赶紧用起来,然后把维护交给定时任务,把判断留给自己。


文章来自于"AI产品普洱",作者 "AI产品普洱"。

AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
AI富文本编辑器

【开源免费】AIEditor.dev是一个开箱即用、并且支持所有前端框架、支持 Markdown 书写模式的AI富文本编辑器。

项目地址:https://github.com/aieditor-team/AiEditor?tab=readme-ov-file

2
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md

3
知识库

【开源免费】FASTGPT是基于LLM的知识库开源项目,提供开箱即用的数据处理、模型调用等能力。整体功能和“Dify”“RAGFlow”项目类似。很多接入微信,飞书的AI项目都基于该项目二次开发。

项目地址:https://github.com/labring/FastGPT

4
prompt

【开源免费】LangGPT 是一个通过结构化和模板化的方法,编写高质量的AI提示词的开源项目。它可以让任何非专业的用户轻松创建高水平的提示词,进而高质量的帮助用户通过AI解决问题。

项目地址:https://github.com/langgptai/LangGPT/blob/main/README_zh.md

在线使用:https://kimi.moonshot.cn/kimiplus/conpg00t7lagbbsfqkq0