RAG到底是什么——用大白话讲清楚检索增强生成

王尘宇 AI百科 3

RAG到底是什么——用大白话讲清楚检索增强生成-第1张图片-王尘宇

2025-2026年AI圈最热的词之一就是RAG。但如果去搜定义,会发现全是论文腔:"检索增强生成是一种结合信息检索与文本生成的混合架构"。看完还是不知道这东西能干嘛。

我用最笨的方式解释一下。

问题:大模型为什么需要RAG

ChatGPT、Claude这些大模型,训练数据是静态的。比如GPT-4的知识截止到2023年12月,之后发生的事它不知道。而且它不知道自己不知道——你问它"2025年诺贝尔奖得主是谁",它会编一个听起来像真的答案,这就是幻觉。

另外,企业内部文档、私有数据库、专业领域知识——大模型训练时没吃过这些数据,它不可能知道你的公司报销流程是什么。

RAG就是解决这两个问题的:让模型能"查资料"再回答,而不是靠记忆硬猜。

原理:三步走

第一步:你问问题。系统不直接发给大模型,而是先拿你的问题去一个知识库里搜索相关文档。

第二步:把搜出来的文档片段和你的问题一起拼成一段提示词,发给大模型。

第三步:大模型基于这些"参考资料"生成答案。因为有具体文档做依据,幻觉大幅减少。

举个例子:你问"2025年公司年会什么时候"。系统去公司内部wiki搜到一篇通知说"2025年1月20日下午3点",然后把这段文字和你的问题一起发给模型。模型回答:"根据公司通知,年会是2025年1月20日下午3点。"

如果不加RAG直接问模型,它可能会说:"作为一个AI,我无法得知您公司的具体安排。"没毛病但没用。

技术实现

实际开发中主要有三块:

① 文档处理:把PDF、网页、数据库里的文本切分成小块(chunk),每块大概500-1000字。太大会检索不准,太小会丢失上下文。

② 向量化(embedding):把每个文本块转换成一个向量(一串数字),相似的文本向量距离近。用OpenAI的text-embedding或者开源的bge模型都行。

③ 检索:用户提问也转成向量,跟知识库里的所有向量做相似度计算,取最相似的top-K个文档块。这个K一般在3-8之间,太多了模型会"分心"。

容易踩的坑

新手最常犯的错误:chunk切分不合理。比如把一段话从中间切断,导致检索出来的片段不完整,模型看不懂上下文。

另一个坑:相似度检索不够精准。关键词匹配有时比向量检索更准,现在主流做法是混合检索(向量+关键词),各取top结果合并。

总结

RAG = 先搜资料,再让AI回答。搜得准、切得好、K不大不小——基本就成功了80%。

一点个人经验

在西安做这行这么多年,电脑慢不一定要换硬件,有时候清理下灰尘、重装下系统,速度能提升30%以上。

你用过最耐用的电子产品是什么?我的一台ThinkPad用了8年还能正常开机。

标签: RAG 检索增强生成 AI基础知识 大模型 向量数据库

发布评论 0条评论)

  • Refresh code

还木有评论哦,快来抢沙发吧~