RAG检索增强生成是什么?大模型开卷考试的秘密

王尘宇 AI百科 2

RAG到底是什么

RAG,全称Retrieval-Augmented Generation,翻译过来叫检索增强生成。名字很唬人,其实原理不复杂。

你可以这样理解:大模型(比如GPT、DeepSeek)本身是一个读过很多书的人,但它读的书有截止日期,而且有时候会记混。RAG做的事情就是——在它回答问题之前,先帮它查一遍资料,把相关的文档找出来塞给它,让它基于这些资料来回答。

就像一个学生开卷考试。闭卷考试靠记忆,开卷考试靠查资料+理解能力。RAG就是给大模型开了卷。

为什么需要RAG

大模型有两个硬伤:

第一,知识有截止日期。你问它2026年6月的最新政策,它大概率答不上来,因为训练数据没覆盖到。

第二,会编。术语叫幻觉(hallucination)。它一本正经地给你编一个看起来很真的答案,但实际上是假的。你不去核实,可能就信了。

RAG的核心价值就在这里:用真实的、最新的文档来约束大模型的输出,减少编造,补充新知识。

RAG的工作流程

拆开来看,RAG分三步:

第一步:检索。用户提了一个问题,系统先去知识库里搜相关的文档片段。这个知识库可以是你公司的内部文档、产品手册、FAQ,也可以是互联网上的公开内容。检索用的技术通常是向量数据库——把文档切成小块,每块转成一个向量,然后用语义相似度来找最相关的几块。

第二步:拼接。把检索到的文档片段和用户的问题一起,拼成一个prompt,发给大模型。

第三步:生成。大模型基于这些资料来回答问题。因为有真实的文档作为依据,回答的准确率会比裸问高不少。

RAG能用在哪

最常见的几个场景:

企业知识库问答。公司内部有几百份文档、制度、流程手册,新员工问请假流程是什么,RAG系统能从这些文档里找到答案,而不是让大模型瞎编一个。

客服系统。把产品FAQ、历史工单喂进去,用户问问题时先检索再回答,比纯靠大模型胡说要靠谱得多。

法律/医疗辅助。这些领域容不得编造。RAG能让大模型在回答时引用具体的法条或医学文献,而不是自己造一个。

RAG的坑

说几个实际做RAG会踩的坑:

切片策略很关键。文档切太大,检索不精准;切太小,上下文丢失。我见过有人把一份200页的产品手册切成1000块,每块50字,结果检索出来的片段没有一个能独立回答问题。后来改成按段落切,每块200-400字,效果好很多。

向量模型选错了白搭。中文场景下,embedding模型的选择直接影响检索质量。用通用模型可能对你的专业领域语义理解不够,需要微调或者换领域专用模型。

检索到了不等于答得好。有时候检索出来的文档确实是相关的,但大模型没用好这些资料——要么忽略了,要么理解错了。这时候需要在prompt工程上下功夫,比如明确告诉模型请基于以下资料回答,不要编造。

RAG和微调怎么选

这是被问得最多的问题。简单回答:

如果你的知识经常更新(比如产品文档、政策法规),用RAG。因为你可以随时更新知识库,不用重新训练模型。

如果你需要模型学会一种固定的风格或能力(比如特定的写作格式、专业的术语使用),考虑微调。

大多数企业场景,RAG就够了。微调的成本高、周期长,而且一旦知识变了又要重新训。RAG灵活得多。

一句话总结

RAG不是什么高深的技术,核心就是先查资料再回答。但要把这个查和答做好,切片、检索、prompt每个环节都得调。别指望装个开源框架就能跑起来——至少得花一两周时间根据自己的数据调参。

标签: RAG 检索增强生成 大模型 AI原理

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~