前面几篇文章,我们主线都在优化大模型模型本身:把模型做更大、做对齐、低成本微调、提升推理效率。
但有一类问题,只靠增大模型参数很难彻底解决: 现实世界的知识一直在更新,总不能一有新信息就重新训练大模型。
而RAG,就是用来解决这个痛点的技术。
RAG 全称 Retrieval-Augmented Generation,中文叫检索增强生成。 核心思想一句话讲明白: 大模型回答问题之前,先去外部知识库检索相关资料;回答的时候,把检索到的文档和用户问题一起作为上下文交给生成模型。
为什么只靠参数不够?
语言模型的知识主要存在参数里。
这有三个麻烦。
第一,更新慢。
如果某个事实今天变了,模型不会自动知道。想更新参数,通常需要重新训练或微调。
第二,来源不清。
模型直接回答时,用户很难知道它依据了哪段材料。
第三,容易编。
当模型没有足够知识时,它仍然可能生成一段看起来很像答案的文本。
RAG 的思路是:不要让模型把所有知识都背在脑子里。把一部分知识放在外部数据库里,需要时再取出来。
RAG 的基本结构
原论文把 RAG 看成两部分的组合:retriever 和 generator。
图 1. 原论文 Figure 1:RAG 将检索器和生成器结合起来。检索器从文档索引中找 top-K 文档,生成器基于输入和检索文档生成答案。来源:Lewis et al., 2020。
流程可以这样理解。
用户提出问题 x。
检索器把问题编码成向量,然后在文档索引里做 Maximum Inner Product Search,也就是 MIPS,找出最相关的 top-K 文档。
生成器不是只看原问题,而是同时看问题和检索到的文档,再生成答案 y。
在论文里,检索器来自 DPR,生成器来自 BART,文档索引主要是 Wikipedia。
这就是 RAG 的基本世界观:
模型参数是 parametric memory,外部文档库是 non-parametric memory。
前者擅长语言和模式,后者擅长存事实、可更新、可追溯。
RAG-Sequence 和 RAG-Token
论文提出两个版本。
RAG-Sequence:一整段回答使用同一批检索文档。
直觉上,它像写文章前先查几篇资料,然后整篇都参考这些资料。
RAG-Token:每生成一个 token,都可以对不同文档分配不同权重。
直觉上,它更灵活。生成到某个事实时,可以更多依赖某篇文档;生成到另一个事实时,又可以切换关注点。
论文把检索文档当成 latent variable,也就是隐藏变量,通过对多个文档的生成概率做边际化,让模型学会“哪些资料对当前回答更有用”。
这比今天很多工程版 RAG 更学术一些。
现在常见的生产 RAG 往往是:向量库检索、重排、拼上下文、交给大模型回答。它不一定端到端训练,但思想根源正是这篇论文。
实验结果说明了什么?
RAG 在开放域问答、生成、事实验证等任务上都有提升。
图 2. 原论文 Table 1 和 Table 2:RAG 在开放域问答、生成和事实验证任务上的结果。来源:Lewis et al., 2020。
在 Open-Domain QA 中,RAG-Sequence 在 NQ 上达到 44.5,超过 DPR 的 41.5;在 CuratedTrec 上达到 52.2,也超过多个基线。
在生成任务上,RAG 相比 BART 更具体、更事实化。论文的人类评估也显示,在 Jeopardy Question Generation 任务中,评审认为 RAG 更事实的比例明显高于 BART。
这些结果背后的重点是:
生成模型不是不能回答知识问题,而是需要更可靠的知识入口。
RAG 给了它一个入口。
为什么 RAG 对今天仍然重要?
今天很多企业做大模型应用,第一反应就是 RAG。
原因很现实。
企业有自己的知识库、文档、产品手册、合同、数据库说明、客服记录。它们不可能全部塞进模型参数里,也不应该全部拿去训练。
RAG 提供了一个更灵活的方案:
知识存在外部系统里,模型负责理解问题、组织语言和综合信息。
资料更新了,只要更新索引;用户追问时,也可以返回引用来源。
这就是为什么 RAG 常被称为大模型落地的第一块积木。
RAG 也不是万能药
很多人以为加了 RAG,幻觉就没了。
这不对。
RAG 只是把问题拆开了。
如果检索不到正确资料,模型仍然可能答错。
如果切分 chunk 不合理,关键上下文可能被拆散。
如果召回太多、排序太差,模型可能被无关内容干扰。
如果提示词没有约束引用方式,模型也可能拿着资料继续自由发挥。
所以一个好的 RAG 系统,至少需要检索、重排、上下文组织、引用、拒答和评估一起设计。
RAG 的价值不是让模型自动正确,而是给模型一个更可靠的知识工作台。
小结
RAG 这篇论文,可以记住四点。
第一,模型参数里的知识更新慢、来源不透明,外部检索可以补上这部分短板。
第二,RAG 把 retriever 和 generator 结合起来,让模型先查资料再生成答案。
第三,RAG-Sequence 和 RAG-Token 分别代表“整段共用资料”和“逐 token 动态依赖资料”的两种建模方式。
第四,今天工程上的 RAG 不一定完全复现论文训练方式,但核心思想仍然来自这里。
从这一篇开始,我们进入“检索、工具与行动”阶段。
模型不再只是闭着眼生成,而是开始连接外部世界。
最后
当下AI大模型是当下实打实的优质风口,岗位缺口大、发展前景广、薪资待遇突出,对比内卷严重、涨薪晋升困难的传统技术岗,是普通人转行逆袭的绝佳选择。
但很多想要入局大模型领域的朋友,都面临无系统学习路径、无实战资源、求职无方向的难题,一个人硬啃最容易走弯路、浪费大量时间精力。这里我结合多年一线实战与教学经验,整理出一套零基础大模型专属资料,包含:
- 系统化学习路线图(零基础到精通)
- 大模型学习书籍 & 文档(电子版)
- 2026 最新行业报告
- 项目实战 & 配套源码
- 大厂面试真题
需要的朋友,微信扫描下方 CSDN 官方认证二维码免费领取,保证 100% 免费。
👇👇扫码免费领取全部内容👇👇
下面简单介绍一下资料包含的内容:
1、大模型系统化学习路线图
专属定制从零基础入门到企业级实战的全阶段学习体系,划分清晰的四大学习阶段,规避碎片化学习弊端,适配新手
2、0基础到进阶视频教程
配套完整高清实操教程,覆盖Prompt提示工程、RAG知识库搭建、Agent智能体开发、模型微调、部署落地等核心知识点,所有课程搭配实操演示,零基础也能轻松看懂、上手实操。
3、大模型学习书籍 & 文档
汇总30+本行业经典AI、大模型、深度学习精选书籍,涵盖理论原理、开发实战、算法基础、AI产品思维等各类内容
4、AI大模型最新行业报告
整理2024-2026年最新大模型行业白皮书、市场分析报告,清晰展现行业发展趋势、技术迭代方向、岗位需求变化,帮助学习者精准把握行业风口,找准学习和就业方向
5、大厂面试真题
汇总了常见的AI大模型面试问题、知识点梳理和面经参考,方便求职时针对性准备。
6、大模型项目实战 & 配套源码
包含GPT应用开发、RAG私有知识库、智能问答系统等多个企业级实战项目,配套完整可运行源码,从简易Demo到完整商业应用全覆盖,帮助学习者将理论转化为落地实战能力,积累项目经验。
7、适合谁学?
- 传统后端 / Java / 前端开发,想转型 AI 应用
- 大学生、应届生,想拿更好的 offer
- 产品经理、运营,想武装职业竞争力
- 技术负责人,想给团队落地提效
学习是反人性的,但回报是真金白银。技术会更新,赛道会切换,但只要你先动手,机会就永远站在你这边。
8、这些资料真的有用吗?
这份资料由我和鲁为民博士(北京清华大学学士和美国加州理工学院博士)共同整理,现任上海殷泊信息科技CEO,其创立的MoPaaS云平台获Forrester全球’强劲表现者’认证,服务航天科工、国家电网等1000+企业,以第一作者在IEEE Transactions发表论文50+篇,获NASA JPL火星探测系统强化学习专利等35项中美专利。本套AI大模型课程由清华大学-加州理工双料博士、吴文俊人工智能奖得主鲁为民教授领衔研发。
资料内容涵盖了从入门到进阶的各类视频教程和实战项目,无论你是小白还是有些技术基础的技术人员,这份资料都绝对能帮助你提升薪资待遇,转行大模型岗位。
想要入局AI大模型赛道、抢占行业红利的朋友,微信扫描下方CSDN官方认证二维码,即可100%免费领取全套学习资料!