RAG 是什么?一文讲清给大模型外挂知识库的原理

2026-06-17

RAG(Retrieval-Augmented Generation,检索增强生成)是一种让大模型”先查资料、再回答”的技术:在生成答案前,先从你的知识库里检索相关内容,把它塞进提示词,让模型基于这些资料作答。 一句话——给大模型外挂一个企业知识库。它是今天企业落地 AI、搭建 AI 数字员工最常用的方案之一。

为什么需要 RAG

直接问 ChatGPT 这类大模型,有两个绕不开的短板:

  • 它不知道你的私有信息。公司的产品手册、内部制度、客户资料,模型训练时没见过,自然答不出。
  • 它会”一本正经地胡说八道”。模型不确定时也会编,这叫幻觉(规划中)。在企业场景里,错误答案的代价很高。

RAG 同时解决这两点:把答案的依据从”模型脑子里的记忆”换成”你给的真实资料”。模型不再凭空回忆,而是照着检索到的文档回答,既能用上私有知识,又大幅减少瞎编。

RAG 是怎么工作的:四步

可以把 RAG 想成”开卷考试”——答题前先翻到相关那几页,再照着写。完整流程分四步,每一步都有具体的工程讲究,不是随便切切、随便查查就能用:

  1. 切分与入库(建知识库):把你的文档(手册、FAQ、合同、网页)切成小段,转成”向量”(一串能表示语义的数字),存进向量数据库。这一步是一次性的准备工作,但也是整个 RAG 效果好坏的地基——切分策略选错,后面查得再准也白搭。
  2. 检索(Retrieval):用户提问时,把问题也转成向量,去库里找语义最相近的几段内容。注意是按”意思”找,不是按关键词,所以问法不同也能命中。
  3. 增强(Augmented):把检索到的文档片段和用户问题拼成一个提示词,相当于告诉模型”请根据下面这些资料回答问题”。
  4. 生成(Generation):大模型基于这份”资料 + 问题”生成答案,通常还会标注引用来源,方便用户核对。

这套机制的好处是:知识库一更新,AI 的回答立刻跟着更新,不用重新训练模型

切分(Chunking):多数团队第一次就踩的坑

不少人第一次搭 RAG,直接把文档按固定长度(比如每 500 字)硬切一刀,结果一句话被拦腰砍断、上下文丢了,检索回来的片段读不通。几个更实用的做法:

  • 按语义边界切,而不是按字数切:优先在段落、小标题处断开,字数只是上限参考(常见区间 300~800 字符,中文文档偏短一些更稳)。
  • 留重叠(overlap):相邻两段之间保留 10%~20% 的重叠内容,避免关键信息刚好卡在切分点上被切没。
  • 给每段配元数据:来源文件名、章节标题、更新时间都存下来,方便后续按条件过滤(比如只查”2026 年版”的制度文档),也方便标注引用来源。
  • 表格、图表单独处理:表格直接切进纯文本段落基本等于废掉,效果最好的做法是先把表格转成结构化描述(比如”某产品在某规格下的参数是……”)再入库。

检索调优:光”能查到”不够,要”查得准”

很多 RAG 效果差,问题不在生成,而在检索这一步就没找对内容。几个关键参数和技巧:

  • Top-K 别设太小也别太大:只取最相似的 1~2 段,容易漏掉互补信息;一次塞 10 段以上,又会让模型”注意力”被稀释、答案变得含糊。常见的实践区间是 3~8 段,具体看文档密度调。
  • 混合检索(Hybrid Search):纯靠向量的语义检索,遇到型号、编码、专有名词这类需要精确匹配的内容反而容易漏检。更稳的做法是把语义检索和关键词检索(如 BM25)结合起来,各取所长。
  • 加一层重排序(Rerank):先用向量检索快速捞回二三十条候选,再用一个专门的 rerank 模型对这些候选重新打分排序,取排名靠前的几条送进提示词。这一步能明显提升”检索到的内容是不是真的相关”。
  • 向量数据库怎么选:小规模、想快速起步,Chroma、Milvus Lite 这类轻量方案够用;数据量大、要上生产,Milvus、Qdrant、Pinecone 这类支持水平扩展和过滤查询的更合适。选型别只看性能榜,先看团队是否有能力运维。

生成端的约束:别让模型”自由发挥”

拿到检索结果后,提示词里最好明确写清楚规则,而不是简单甩一句”请参考以下资料回答”:

  • 明确要求”只根据提供的资料回答,资料中没有的内容要如实说不知道,不要编造”;
  • 要求模型在答案里标注具体引用了第几段资料,方便人工核对;
  • 对没检索到相关内容的情况,提前设计一个兜底话术(比如转人工、提示换个问法),而不是让模型硬凑答案。

RAG、微调、长上下文,企业该怎么选

这是落地时最常纠结的问题。三者解决的不是同一件事,一张表说清楚:

维度RAG微调长上下文
解决什么问题灌输会变化的私有知识改变语气/格式/专门任务能力临时塞入少量参考资料
知识更新方式更新知识库即可,实时生效需要重新训练,周期长每次对话手动传入
适合的知识量大(几千到几百万条文档)不适合灌输大量事实小(几十页以内,受窗口和成本限制)
落地成本中等,主要是工程调优较高,需要标注数据和训练资源低,但每次调用都要重新付费传资料
典型场景客服问答、知识库检索统一话术风格、结构化输出格式一次性分析单篇长文档
  • RAG:让模型用上会变化的、量大的私有知识(产品库、政策、客服记录)。首选方案,性价比高、更新快。
  • 微调(Fine-tuning):改变模型的风格、语气、固定格式或让它学会某种专门任务。它不擅长灌输大量事实知识。
  • 长上下文:把资料直接全塞进对话窗口。文档少、临时用可以;资料一多就贵且容易”读不过来”,不适合做企业级知识库。

实务上的判断:要让 AI”懂我们公司的事”,先上 RAG;要让 AI”按我们的方式说话”,再考虑微调。 两者也不是非此即彼,成熟的落地方案常常是”RAG 负责知识、轻量微调负责语气”叠加使用。想深入对比,看提示词工程 vs RAG vs 微调(规划中)。

企业能用 RAG 做什么

RAG 几乎是所有”基于企业知识的 AI 应用”的底座:

  • 智能客服 / 答疑机器人:基于产品手册和 FAQ 自动回答客户与员工。
  • 企业知识库问答:员工用自然语言查制度、流程、历史文档,不用再翻文件夹。
  • 合同 / 文档审查助手:基于法规和模板库辅助审阅。
  • 销售 / 售前助手:基于产品资料快速生成方案、应答客户问题。

这些正是 AI 数字员工的典型岗位。

怎么搭一个 RAG

好消息是,今天搭 RAG 不一定要写代码。低代码平台(如扣子、Dify、n8n)都内置了知识库 + RAG 能力,上传文档、配好问答入口就能跑起来一个原型。真正要做好,难点在工程细节:文档怎么切分、检索怎么调准、答非所问怎么兜底。

一个务实的落地节奏,供你参考:

  1. 第一周:跑通原型。挑 20~50 份最常被问到的文档(FAQ、产品手册),用低代码平台默认配置直接建库,先看看基本能不能用。
  2. 第二周:找出检索差的问题。收集 30~50 个真实提问,人工核对每次检索回来的内容是不是真的相关,把”查不准”的案例挑出来,多半是切分粒度或 Top-K 设置的问题。
  3. 第三周:调优+加约束。针对上一步的问题调整切分策略、加混合检索或 rerank,同时把生成端的”不知道就说不知道”约束写进提示词。
  4. 第四周起:小范围灰度上线,先给内部员工用,收集反馈后再逐步扩大到客户侧。

评估效果别只靠”感觉准不准”,最好定几个可量化的指标去跟踪,比如检索命中率(人工标注的相关文档有没有被检索回来)、答案采纳率(人工客服直接采用 AI 答案的比例)、兜底触发率(多少比例的问题因为查不到内容而转人工)。这几个数字比”看起来还行”靠谱得多,也方便你判断该调检索还是调提示词。

想动手,可以从用 Dify 搭建企业 AI 应用搭建企业 AI 知识库的完整步骤(规划中)入手。

常见问题

RAG 需要懂编程吗? 做原型不需要,低代码平台就能搭;做到生产级、效果稳定,则需要工程能力或专业团队。

RAG 能完全杜绝幻觉吗? 不能,但能大幅减少,并且因为能标注来源,错误更容易被发现和纠正。把检索做准、给模型清晰的”只能根据资料回答”约束,效果会更好。

数据安全吗? 取决于你怎么部署。对敏感数据,可选择私有化部署的模型和向量库,让数据不出内网。

RAG 和 AI Agent 什么关系? RAG 是 Agent 的一种核心能力。会自己规划”何时该检索、检索什么”的进阶形态叫 Agentic RAG(规划中)。


RAG 是企业把 AI 真正用起来的第一块拼图。想系统学会从 RAG 到数字员工的搭建落地?

👉 看看 AI 数字员工落地指南,或了解我们的 数字员工搭建实战课。需要为企业落地一套可用的方案,也欢迎找我们聊 企业服务

想系统学会用 AI?报名体系课或加入会员,照着学、照着用。