大模型很聪明,但它不知道你公司的产品手册、不知道你毕业论文引用了哪些文献。RAG(Retrieval-Augmented Generation,检索增强生成)就是解决这个问题的技术:先从你的资料里检索相关内容,再让 AI 基于这些内容回答。
一句话理解 RAG
开卷考试。
不给 AI 书本(训练时它没见过),而是考试时把相关的几页资料塞给它,让它照着资料作答。
为什么需要 RAG
直接把资料全贴给模型不行吗?三个原因:
- 上下文窗口有限:资料可能有几百万字,塞不下;
- 成本高:每次提问都全文输入,Token 费用惊人;
- 准确性差:内容太长时模型容易"读了后面忘前面"。
RAG 的思路是"按需取用":提问时只检索最相关的几个片段(通常几百到几千字),既省又准。
RAG 的工作流程
- 入库:把文档切分成小段(chunk),每段计算向量(embedding)存入向量数据库;
- 检索:用户提问时,把问题也转成向量,找出语义最相近的几个片段;
- 生成:把问题 + 检索到的片段一起交给大模型,并要求"仅根据以下资料回答"。
常见坑
- 切分太碎或太粗:一段以 300~800 字为宜,并保留标题等上下文信息;
- 检索不准,答案必歪:检索质量决定 RAG 上限,向量检索常需配合关键词检索混合使用;
- 资料更新要同步入库,否则 AI 会拿着旧手册一本正经地胡说。
现在很多笔记软件、企业知识库产品内置的就是 RAG。理解了原理,你就能判断哪些产品是真有用,哪些只是套壳。
本文共 442 个字数,平均阅读时长 ≈ 2分钟
评论