
前言“RAG的本质是高效检索而知识库向量数据库和知识图谱只是组织数据的一种形式”这两天在之前的一篇关于RAG检索增强的文章中有一个评论问RAG和知识图谱的区别这时才发现原来很多人对RAG技术还没有一个本质的认识以及与其相关的本地知识库向量数据库等。所以今天就来介绍一下上面的这些概念以及其联系与区别。RAG——检索增强生成前面写过好几篇关于RAG的文章但可能到现在很多人还不明白什么是RAG——检索增强生成。先说RAG技术产生的背景RAG技术是基于大模型文本生成而产生的一种技术目的是解决大模型的缺陷问题因此就有了RAG技术来帮助大模型简单来说RAG就相当于给大模型配备了一个资料库遇到不懂的问题不要胡扯先去查查资料。大模型主要缺陷知识更新不及时大模型的知识仅限于训练数据的截止时间无法获取之后的知识大模型幻觉问题大模型一本正经的胡说八道大模型知识不足大模型的知识有限很多垂直领域的知识它都不知道RAG技术的运作流程是什么样的呢如上图所示完整呈现了RAG的运作流程RAG技术主要分为三个部分创建资料库查资料带着资料问问题举个生活中的例子你是一个学生有一天遇到一个你不懂的问题然后你爸妈就让你去问邻居家上大学的哥哥姐姐如果是一些常识性的问题那么他们可以直接告诉你结果。但你这个问题比较特殊涉及到具体的专业知识比如说化学物理等这时上大学的哥哥姐姐可能也不知道该怎么回答你的问题但以他多年的学习经验他觉得这个问题他可以解决但需要先看一下你的课本或资料。这个步骤就是RAG中的第三步你就是用户大模型就是邻家的哥哥姐姐而你比较聪明在来的时候就怕哥哥姐姐需要看你的课本你随身就把课本和资料给带着了这个就是第二步。然后邻家的哥哥姐姐看了一会你的课本然后告诉你这个问题应该怎么巴拉巴拉的给你讲然后你的问题就解决了。现在回到RAG的问题为什么需要这三步因为大模型上面的缺陷所以导致大模型能力并不是很强因此有些东西需要查资料才能知道但怎么才给大模型建一个资料库呢这就是第一步比如需要从不同的文档加载数据如wordpdftxt音频视频等然后需要把这些文档中有关联的数据放到一块这个就叫做嵌入(embedding)最后把这些数据存储到一个地方比如向量数据库。第二步就是检索有了这些资料之后怎么才能根据不同的问题从中找到相关联的资料比如你不可能因为一个历史问题就去翻阅整个永乐大典所以这就需要一种检索技术比如目录/索引。接着是第三步你带着第二步检索到的数据给到大模型然后大模型就可以根据这些数据来回答你的问题这时你可能会说既然有了这些资料我自己看不就行了还要大模型干什么那如果你是公司客服你会为每个用户都重新介绍一下你们公司的产品和企业文化吗而这就是整个RAG技术的实现流程每个环节又涉及到不同的技术比如第一步创建资料库需要文档加载技术分词技术嵌入技术等第二步需要向量化技术准确高效的检索技术等第三步需要提示词技术大模型调用技术等因为第二步查到的资料需要放到提示词中让大模型自己去“看”。所以从这里也可以看出严格来说RAG技术和大模型没太大直接关系(这里的没关系是指进行业务处理的大模型而文档嵌入本质上使用的也是嵌入大模型)大模型不管你使用的是什么资料库也不关心你查到了哪些资料大模型关心的只是你最后在提示词中携带的资料。大模型与本地知识向量数据和知识图谱那么RAG和本地知识库向量数据库还有知识图谱有什么关系呢什么是本地知识库本地知识库说白了就是资料库的一种比如说你们公司的技术档案销售记录公司的规章制度等都属于本地知识库的范围本地知识库的作用是把一个组织内部的资料梳理出来方便大家使用。所以本地知识库的本质是资料库而这个资料库可以有多种不同的组织形式比如以文档书籍或者网页视频甚至是会议记录等形式存在也可能是多种形式的混合。而向量数据库是一种存储数据的方式只不过由于大模型的出现导致基于以前的字符存储变成了基于语义的向量存储向量数据库从功能上来说和传统的数据库没有本质区别不论是mysql还是redis只不过传统的数据库是基于字符匹配而向量数据库基于语义匹配(本质上一种数学模型如欧式距离和余弦函数)。向量数据库既然是数据库那么它就具备数据库的特性存储数据和查询数据它是数据存储的载体就类似于工作中的文件夹。而知识图谱又是什么所谓的知识图谱是由谷歌推出的一种搜索引擎技术面对互联网中日益增长的数据怎么表示这些数据以及这些数据之间的关系成为了一个难题因此谷歌就推出了知识图谱技术用这个方式去记录这些数据以及其关联关系。说白了知识图谱就是一种组织数据的方式比如我们日常工作和生活中会按照日期地点任务名称等来存放不同的文件资料。所以本地知识库向量数据库还有知识图谱有什么关系本地知识库即可以使用简单的日期部门工作任务来组织资料也可以使用知识图谱这种更加专业的方式来搭建本地知识库而搭建的本地知识库存储在什么地方即可以存储在传统的关系性数据库中也可以存储在文本文件中当然也可以存储在向量数据库中。这就是其三者之间的关系。那么它们和RAG又有什么关系前面说了RAG是为了解决大模型本身存在的几个缺陷大模型需要的是你在提示词中拼接的最终资料而不会关心你这个资料从哪里来。而RAG就是从外部检索资料然后拼接到大模型提示词中的一种方法论。RAG最终的目的就是准确高效的检索到相关的资料而不管是去知识图谱中检索还是去本地知识库中检索还是去向量数据库中检索亦或者是从传统的关系型数据库中检索或者直接去网络上搜索。比如说你想让大模型告诉你怎么做西红柿炒蛋你需要的是使用RAG技术检索到做番茄炒蛋的内容而不是告诉大模型哪里大米产量高哪里发生了自然灾害原子弹怎么造。而至于你这个资料是从哪家餐厅的菜谱中找到的还是从网络上搜索到的或者还是路边听说的都可以。问题传统数据库可以用来做RAG吗答案是可以比如说价格表这种精确的不需要语义检索的数据使用传统数据库效果会更好。一般企业场景中是把语义检索和字符匹配同时使用需要语义理解的就使用语义检索库比如向量数据库精确的数据就放到传统数据库中。总结RAG是一种从外部检索数据的方式本地知识库相当于一个资料库而知识图谱是组织数据的一种更加科学的方式向量数据库是用来存储向量化数据的一个载体。所以本地知识库向量数据库和知识图谱和RAG没什么直接关系如果说有关系就是它们三者可以作为RAG技术的一种具体实现但RAG也可以使用其它的实现方式。RAG本地知识库向量数据库知识图谱是四个完全独立的技术它们之间没有任何直接关系但又可以互相合作以达到某种效果。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】