Appearance
LLM Wiki开源项目:把Karpathy知识库理念变成现实
有人把Karpathy的LLM Wiki构想变成了现实。跨平台桌面应用、知识图谱可视化、深度研究、网页剪藏、向量搜索——功能比原版Gist设想丰富太多。目前3300+Star。
一句话说清楚
LLM Wiki是一个跨平台桌面应用,你把文档丢进去,它自动帮你生成一个结构化的、互相链接的个人Wiki知识库。
和传统RAG的区别:LLM先把文档吃透,生成Wiki页面、建立交叉引用、标注矛盾点,后续提问直接在Wiki上做。知识编译一次,持续保持最新。
两步链式思考录入
第一步:分析
LLM先通读文档,提取关键实体、概念、论点,找和已有Wiki内容的关联,发现矛盾和张力,给出结构化分析结果。
第二步:生成
LLM拿着分析结果,才开始写Wiki页面:生成摘要页、实体页、概念页,更新索引,建立交叉引用,标注需要人工判断的事项。
拆成两步的好处:让LLM先想清楚再动手写,比边想边写质量高太多。
一个来源录入可能牵动10-15个Wiki页面更新,LLM自动把新知识和已有知识网络串联起来。
SHA256增量缓存:每个文件录入前算哈希,没改过的自动跳过,省token也省时间。
知识图谱可视化
用四个维度衡量Wiki页面关联程度:
| 维度 | 权重 | 说明 |
|---|---|---|
| 直接链接 | x3.0 | 页面有wikilinks直接引用 |
| 来源重叠 | x4.0 | 两个页面引用了同一个原始文档 |
| Adamic-Adar | x1.5 | 有共同邻居,越稀有关联越强 |
| 类型亲和度 | x1.0 | 同类型页面额外加分 |
可视化用sigma.js + ForceAtlas2布局:
- 节点颜色按类型或社区聚类着色
- 节点大小按链接数量缩放
- 悬停时关联节点保持高亮
- 集成Louvain社区发现算法自动识别知识集群
图谱洞察:最有价值的功能
系统自动分析图谱结构,给出两种洞察:
1. 意外关联
跨社区、跨类型、意料之外的连接。比如两批毫不相干的资料突然出现连接它们的边——这种发现往往是认知突破的起点。
2. 知识缺口
- 几乎没有连接的孤立页面
- 内部交叉引用太少的稀疏社区
- 同时连接三个以上集群的桥接节点
每个缺口旁边都有深度研究按钮,点一下LLM自动上网搜资料补全。
深度研究:知识库自己补全自己
系统发现知识缺口后:
- LLM自动生成搜索关键词
- 调用Tavily API上网搜索
- 综合分析结果,写成研究页面直接写进Wiki
- 研究页面自动触发录入流程,提取新实体和概念整合到知识网络
触发方式:LLM先读overview.md和purpose.md理解知识库主题,生成针对性搜索词——不是泛泛关键词,而是根据已有知识的上下文精确定位。
Chrome网页剪藏
- Readability.js自动去掉广告、导航栏、侧边栏
- Turndown.js转成干净Markdown
- 剪藏内容自动发送到本地应用触发录入
- 支持多项目选择
- 应用没开着也能预览,打开后自动同步
检索优化:多阶段管线
| 阶段 | 方法 |
|---|---|
| 第一阶段 | 分词搜索,中文做CJK二元组分词 |
| 第二阶段 | 向量语义搜索(LanceDB) |
| 第三阶段 | 关联度模型2跳遍历 |
召回率提升:开向量搜索后从58.2%提升到71.4%。
上下文窗口可配置从4K到1M tokens:60% Wiki页面、20%聊天历史、5%索引、15%系统提示。
关键细节
| 功能 | 说明 |
|---|---|
| purpose.md | 定义目标、关键问题、研究范围,LLM每次录入和查询都参考 |
| 异步审核 | LLM拿不准的事标记到审核队列,不阻塞主流程 |
| 删除级联 | 删资料文件自动清理Wiki摘要页、引用页、索引条目、失效链接 |
| 多格式支持 | PDF、DOCX、PPTX、Excel、图片、音视频都能导入 |
| Obsidian兼容 | 生成的Wiki目录就是标准Obsidian Vault |
总结
| 要点 | 说明 |
|---|---|
| 核心设计 | 两步链式思考,先分析再生成 |
| 知识图谱 | 四维度关联度+Louvain社区发现 |
| 洞察功能 | 发现意外关联和知识缺口 |
| 自动补全 | 深度研究自动搜索填充缺口 |
Karpathy说的"知识复利增长",这个项目变成了现实。
GitHub:https://github.com/nashsu/llm_wiki
关键词:LLM Wiki, Karpathy知识库, 知识图谱可视化, 深度研究, 网页剪藏, 向量搜索
