RAGFlow — 把公司文档喂给大模型,它终于不说胡话了
概述¶
RAGFlow(81.9K Star)是一个开源生产级 RAG 引擎,把公司文档变成 AI 知识库。自研深度文档解析引擎搞定 PDF/扫描件/表格,混合检索(语义+关键词+重排序)保证回答准确,让大模型不再胡说八道。
要点¶
- 81.9K Stars,开源生产级 RAG 引擎
- 自研深度文档解析,PDF/表格/多栏排版不乱码
- 混合检索:语义搜索+关键词命中+Reranker 重排序
- 解决大模型对公司私有数据不了解、容易幻觉的问题
把公司几百页的产品手册、技术文档一股脑扔给 ChatGPT,问它"咱们的退款政策是什么",它给你来了一段特别自信的回答,数据来源、逻辑都很对,但退款比例是错的。你再追问,它道歉、改口,再给一个同样自信但同样错的版本。
这不是 ChatGPT 不行,是大模型天生就不适合做知识问答。它记不住你的私有数据,也不清楚哪些信息是事实、哪些是它自由发挥的。
所以 RAG(检索增强生成)这两年成了 AI 落地的头号关键词。你的文档还是你的文档,大模型只负责「读懂了然后回答」——不是凭记忆瞎编。
但问题来了:RAG 听起来简单,真要搭一套能用的、响应快的、幻觉少的系统,坑比想象的多。
直到我看到了 RAGFlow。
核心逻辑¶
RAGFlow 是什么?一句话:一个开源的、生产级的 RAG 引擎,让你用自己的文档搭建 AI 知识库。
它的核心思路并不复杂——把你给的文档切碎、索引、存起来,当你提问时,先去库里找到最相关的内容片段,再把片段塞给大模型做参考回答。
但 RAGFlow 做了三件很多人没做好的事:
第一,文档解析不是闹着玩的。 市面上大部分 RAG 项目对 PDF、扫描件、表格的解析能力极弱,一段排版稍微复杂的合同被解析成乱码。RAGFlow 自己搞了一套深度文档解析引擎,对表格、多栏、页眉页脚都做了专门处理。
第二,检索精度打磨到位。 它支持混合检索(语义 + 关键词 + 重排序),不是简单的 embedding 搜一下完事。对同一个问题,它能综合相似度匹配加关键词命中,再通过 Reranker 把最靠谱的几个片段排到最前面。
第三,把 Agent 能力揉了进来。 纯粹的 RAG 是模式固定的:搜、拼、答。但 RAGFlow 加了一层 Agent 逻辑:可以多轮追问、可以拆分复杂问题、可以联动外部工具。
功能盘点¶
| 功能 | 说明 |
|---|---|
| 深度文档解析 | 支持 PDF、Word、Excel、PPT、图片扫描件 |
| 混合检索 | 语义搜索 + 全文检索 + Reranker 重排序 |
| Agent 编排 | 内置 Agent 节点,可设计多步推理链路 |
| 可视化工作流 | 拖拽式的 LLM + RAG 编排界面 |
| 多源数据接入 | 支持 API、S3、本地文件、数据库 |
| 企业级权限 | 用户、角色、文档级权限控制 |
| RESTful API | 所有能力都有 API 封装 |
典型场景¶
适合谁:
- 知识密集型企业:公司有成百上千份 SOP、产品手册、合规文档
- 客服/售后团队:把常见 FAQ、产品参数扔进去,客服直接问就行
- 研发团队:项目文档、API 文档、内部 Wiki 整合成一个可对话的知识库
几个坑:
1. 中文文档处理依然有挑战,手写体、复杂公式可能翻车
2. 资源消耗不低,建议至少 8GB 内存 + GPU
3. Chunk 策略需要调参,每个业务场景的最佳切块策略得自己试
15 分钟上手¶
docker run -d --name ragflow -p 9380:9380 -v ~/ragflow_data:/ragflow/data infininiflow/ragflow:latest
浏览器打开 http://localhost:9380,注册账号,创建数据集,把 PDF 拖进去。RAGFlow 自动解析、切片、索引。
在「对话」页面选择知识库,直接提问。回答末尾会引用来源,能点进去对照原文。
总结¶
RAGFlow 解决的不是"有没有 RAG",而是"RAG 能不能用"。如果你想给团队搭一个内部知识问答系统,不用再自己从零拼 LangChain + ChromaDB + FastAPI 了。
GitHub 地址:https://github.com/infiniflow/ragflow