
知识科普关于模型大语言模型LLM是通过深度学习技术基于海量历史文本数据训练出的概率生成系统。能力边界知识时效性模型知识截止于训练数据时间点推理局限性本质是概率预测而非逻辑运算复杂数学推理易出错deepseek的架构有所不同专业领域盲区缺乏垂直领域知识幻觉现象可能生成看似合理但实际错误的内容更新机制全量重训练需重新处理TB级数据消耗数千GPU小时这个我们直接排除微调(Fine-tuning)用领域数据调整模型参数成本仍较高这个也需要一定的成本上下文学习通过提示词临时注入知识但受限于上下文长度这个我们通过外挂知识库实现综上我们能做的更新机制就是给它通过提示词上下文临时注入知识。关于知识库维度广义知识库模型知识库数据来源外部结构化/非结构化数据文档、数据库等预训练模型内嵌的知识如GPT的训练数据更新方式手动或API动态更新如企业知识库依赖模型重训练或微调知识范围垂直领域或特定业务场景如产品手册通用知识训练数据截止时间前的信息我们之前说的知识库都是广义知识库。在关于模型哪里我们说了我们可以通过提示词临时注入知识给大模型但是大模型的上下文是有长度限制的我们通过各种技术把最合适的内容挑选出来然后给大模型。关于嵌入模型嵌入模型是一种将高维离散数据文本、图像等转换为低维连续向量的技术这种转换让机器能更好地理解和处理复杂数据。举一个例子来理解向量你正在玩一个叫做猜词的游戏。你的目标是描述一个词而你的朋友们要根据你的描述猜出这个词。你不能直接说出这个词而是要用其他相关的词来描述它。例如你可以用热、“喝”、“早餐来描述咖啡”。嵌入模型就是将一个词转化为其他相关词的专用模型。“热”、“喝”、“早餐” 可以理解为向量。不过向量值是在向量空间的特定位置在这个空间里语义相近的词会自动聚集起来。所以就有了相似度的概念相似度越高越匹配。我们使用的bge-m3 只能向量化出1024维。ollama show bge-m3:latest architecture bert parameters 566.70M context length 8192 embedding length 1024 quantization F16为什么没有匹配到知识知识预处理1 上传文档2将文档分割成适当大小的文本块3使用embedding模型将每个文本段转换为向量4将向量和原文存储到向量数据库中查询处理阶段1将用户输入问题转换为向量2 在向量库中检索相似内容3 将检索到的相关内容作为上下文提供给LLM我们用的本地应用工具一般都是粗粒度分段向量化的质量没法保证。本地知识库安全吗根据上一步我们可以知道本地知识库本地大模型是安全的。本地知识库远端api的大模型会把片段上传。dify安装前提条件假设你已经安装了dockerdocker安装不同的架构安装方式不一样这里就不做教程了。 已经登录了docker安装完docker以后记得调整docker镜像的存储地址。已经安装了docker并且登录了已经安装了git win上docker安装地址 https://docs.docker.com/desktop/setup/install/windows-install/#wsl-2-backend安装下载dify通过官网下载如果你没有魔法可以从网盘里那对应的# 进入要下载的目录打卡命令提示行工具cmd或者powershell cd E:\ai\code #下载 git clone https://github.com/langgenius/dify.git # 国内镜像站 https://gitee.com/dify_ai/dify如果没有git环境可以直接从网盘下载压缩包。我们下载以后只关注docker文件夹和README_CN.md即可。清理非必须由于我的dify安装的比较早是0.7.x版本为了给大家演示就把原来的铲了。如果你以前安装过dify使用以下命令清理历史镜像cd docker 进入目录 # 清理历史镜像 docker-compose down -v --rmi all创建配置我们进入dify目录下的docker目录中,比如我的 E:\ai\code\dify\docker# 以示例创建一个.env的文件执行下面命令 cp .\.env.example .env修改dify绑定ipAPI 服务绑定地址默认0.0.0.0即所有地址均可访问。 刚开始我以为是控制dify对外暴露的服务的改成了127.0.0.1,然后出现以下的502折腾了我快3个小时。修改端口非必须默认占用的是80和443端口如果你本机已经部署了其他的应用占了该端口修改.env文件中的下面两个变量EXPOSE_NGINX_PORT8001EXPOSE_NGINX_SSL_PORT8443上传文件大小默认上传图片大小是10MB,上传视频大小是100MB,文件默认是50MB,如果有需要修改下面对应的参数# Upload image file size limit, default 10M.UPLOAD_IMAGE_FILE_SIZE_LIMIT10# Upload video file size limit, default 100M.UPLOAD_VIDEO_FILE_SIZE_LIMIT100# Upload audio file size limit, default 50M.UPLOAD_AUDIO_FILE_SIZE_LIMIT50启动difydocker compose up-d启动以后在docker Desktop中查看设置管理员与登录http://127.0.0.1:8001/install填写相关信息设置管理员账户。设置成功以后登录设置模型1点击右上角的账户 2点击设置本地模型设置1 点击模型供应商 2下拉找到ollama 3点击添加模型添加对话模型按照步骤添加模型即可注意模型上下文长度可以通过ollama show 模型名称查看如果你经常用大文本就直接调到最大值。需要注意的是dify上传文件是有大小限制的。关于ip我使用的是本地docker虚拟网络如果你ollama设置了OLLAMA_HOST为0.0.0.0需要注意网络安全防止外网有人能访问。我是将我的ollama绑定到了局域网ip上了。添加向量模型1注意选择text embedding系统模型设置1点击系统模型设置2选择已经配置的模型当然建立知识库的时候也可以切换3选择向量模型4保存在线api模型配置腾讯模型配置免费到2月25日没找到对应的模型供应商直接选择openai兼容的模型供应商。按步骤填写即可。2模型名称选择deepseek-r13api key 填写自己的即可4填写地址https://api.lkeap.cloud.tencent.com/v1硅基流动添加找到模型供应商点击设置配置下密钥就可以了。模型供应商配置好以后我们可以在模型列表那里看到所有的模型最终系统模型设置知识库设置创建知识库分段dify的分段有个好处设置分段以后可以实时预览可以根据预览效果自己实时调整分段策略。dify建议首次创建知识库使用父子分段模式。通用分段原自动分段与清洗关键点1默认\n作为分段标识2最大分段长度为4000tokens默认为500tokens3分段重叠长度默认为50tokens用于分段时段与段之间存在一定的重叠部分。建议设置为分段长度 Tokens 数的 10-25%4文本预处理规则用于移除冗余符号、URL等噪声5这里还有一个点向量模型会自动按段落或语义进行切分也就是大家分段以后内容缺失的根因。适用于内容简单、结构清晰的文档如FAQ列表父子分段父子模式采用双层分段结构来平衡检索的精确度和上下文信息,让精准匹配与全面的上下文信息二者兼得。关键点1父区块Parent-chunk保持较大的文本单位如段落上下文内容丰富且连贯。默认以\n\n为分段标识如果知识不长可以以整个作为父区块超过1万个分段就直接被截断了。2子区块Child-chunk以较小的文本单位如句子用于精确检索。默认以\n为分段标识。3也可以选择噪音清理4在搜索时通过子区块精确检索后获取父区块来补充上下文信息从而给LLM的上下文内容更丰富以句子为最小单位向量化以后向量匹配的准确度会极大的提升。官方示意图如下1我们可以不断的调整参数预览下看下实际效果索引模式索引模式有两种。分别是高质量索引和经济索引高质量索引适用场景需要高精度语义检索如复杂问答、多语言支持。实现方式依赖嵌入模型生成向量索引结合 ReRank 模型优化排序。**适用文档**格式化文档如表格、技术手册我们看下官方推荐的配置1选择高质量3选择向量模型4选择系统推荐的混合检索5选择Rerank模型并选择对应的rerank模型经济索引适用场景预算有限或内容简单如关键词匹配为主的FAQ。实现方式使用离线向量引擎或关键词索引无需消耗额外 Token但语义理解能力较弱。优化建议可通过调整TopK返回相似片段数量和Score 阈值相似度过滤平衡召回率与准确率。**适用文档非结构化文本如会议记录使用创建应用点击工作室我们可以看到有很多丰富的应用包括聊天助手、agent、工作流等 我们选择最简单的应用聊天助手点击5创建空白应用添加知识库知识库可以一次选多个我们只选择三国演义。召回设置1选择Rerank模型2选择相关的模型3设置召回数量文本片段数量4相似度匹配设置0.7调试与预览1输入聊天内容2点击发送3调试成功以后可以点击发布发布以后有多种适用方式。返回工作室以后我们可以发现已经有对应的应用了。最后的最后感谢你们的阅读和喜欢作为一位在一线互联网行业奋斗多年的老兵我深知在这个瞬息万变的技术领域中持续学习和进步的重要性。为了帮助更多热爱技术、渴望成长的朋友我特别整理了一份涵盖大模型领域的宝贵资料集。这些资料不仅是我多年积累的心血结晶也是我在行业一线实战经验的总结。这些学习资料不仅深入浅出而且非常实用让大家系统而高效地掌握AI大模型的各个知识点。如果你愿意花时间沉下心来学习相信它们一定能为你提供实质性的帮助。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】大模型知识脑图为了成为更好的 AI大模型 开发者这里为大家提供了总的路线图。它的用处就在于你可以按照上面的知识点去找对应的学习资源保证自己学得较为全面。经典书籍阅读阅读AI大模型经典书籍可以帮助读者提高技术水平开拓视野掌握核心技术提高解决问题的能力同时也可以借鉴他人的经验。对于想要深入学习AI大模型开发的读者来说阅读经典书籍是非常有必要的。实战案例光学理论是没用的要学会跟着一起敲要动手实操才能将自己的所学运用到实际当中去这时候可以搞点实战案例来学习。面试资料我们学习AI大模型必然是想找到高薪的工作下面这些面试题都是总结当前最新、最热、最高频的面试题并且每道题都有详细的答案面试前刷完这套面试题资料小小offer不在话下640套AI大模型报告合集这套包含640份报告的合集涵盖了AI大模型的理论研究、技术实现、行业应用等多个方面。无论您是科研人员、工程师还是对AI大模型感兴趣的爱好者这套报告合集都将为您提供宝贵的信息和启示。这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】