最近在 GitHub 上翻到港大 HKUDS 出的 RAG-Anything,自己部署跑了一圈,结论先放前面:想搭本地个人知识库、又懒得拼 OCR、切分、向量化那套流水线的人,这套目前是我见过最省心的一体化方案。
它本质是架在 LightRAG 上的一套端到端多模态管道,PDF、PPT、Word、Excel、甚至图片直接丢进去就行。真正让我眼前一亮的是它把表格、图片、公式当成和文字同等的检索对象。我拿一份带扫描截图的内部文档测,截图里那个公式表格它居然能向量化后检索回来,不用自己写识别逻辑,这点确实省了大功夫。
本地部署基本一条命令,文件不出本机。比起把合同、论文这类敏感资料上传给第三方 AI,安全感不在一个量级。开源可 fork,检索策略想改就改,对爱折腾的人很友好。其实
当然别神话。首次建索引吃显卡或 API 额度,语料一大明显变慢,多模态解析偶尔也漏识别。但从某种角度看,它把 RAG 里最脏最累的工程活打包好了,对比纯手写性价比摆在那。你们本地知识库现在用的啥,有更顺手的也踢我一下。