别急着上向量库:手搓一个能引用出处的 RAG Agent

发布时间:2026/8/7 15:39:06
别急着上向量库:手搓一个能引用出处的 RAG Agent 很多人一听说「私有知识问答」第一反应是向量数据库 Embedding LangChain。我自己踩过这个坑——笔记一共就十几篇 Markdown也去搭检索链路最后发现模型胡编不是因为没有向量而是因为检索结果空了它还在硬答反过来文档很少时直接塞进上下文往往更稳、更便宜。所以这篇先不卖框架只讲清三件事1. RAG 到底解决什么以及不解决什么2. 什么时候该上、什么时候别上3. 用 TypeScript DeepSeek 手搓一个最小版本地 Markdown → 分块 → 关键词召回 → Agent 强制引用出处适合谁 想给 Agent 接内部文档 / 个人笔记又还没决定要不要上向量库的人。不太适合谁 已经在调 FAISS/Milvus 性能的人——这篇是判断与最小闭环不是检索调优专题。一句话先记住RAG 先从知识库捞出相关片段再交给模型回答。它解决的是「模型没见过 / 上下文塞不下」不是「模型不够聪明」。没有检索的生成容易一本正经地胡说没有必要的 RAG则是在给自己加运维负担。三种喂知识的方式方式做法适合代价全量塞上下文把文档直接贴进 Prompt文档少、总长远小于上下文窗口贵、吵、一超就崩工具式检索search_notes一类关键词搜索笔记/文件量中等、查询词明确语义相近但用词不同时易漏RAG分块 召回切块 → 建索引 → Top-K 片段进 Prompt文档多、问题开放、需要引用原文分块/召回质量决定上限第 0306 篇里的search_notes其实是「极简检索工具」。RAG 是把检索工程化分块策略、相关性排序、引用约束、失败时怎么办。什么时候该上 RAG满足多数条件再上1. 知识在模型训练数据之外内部文档、私有笔记、产品手册2. 总量明显大于舒服的上下文预算经验经常要选片而不是偶尔贴一份3. 答案需要可追溯最好能指出「来自哪段文档」4. 内容会更新全量塞 Prompt 每次都要重贴索引可增量更新什么时候别上场景更合适的做法只有 35 页说明书直接塞上下文或一次读文件工具步骤固定的查表/算数Workflow 或普通函数别绕模型问的是常识/公开知识直接问模型即可你还没验证「检索是否找得到」先做关键词搜索 Demo别先上向量库问题其实是「记得用户说过什么」那是第 05 篇的记忆不是 RAG经验法则能用读文件 短上下文解决的先别上 RAG检索经常空结果的先改分块与查询再谈换向量模型。RAG 流水线四步文档 → ① 分块(Chunk) → ② 建索引(Index) ↓ 用户问题 → ③ 召回(Retrieve Top-K) → ④ 注入 Prompt → 模型生成对照 Agent①② 通常在「离线 / 启动时」做完③ 变成工具search_knowledge(query)④ 把工具返回的片段当作 Observation再生成答案所以 RAG Agent 仍然是你熟悉的 Tool Loop——只是工具背后换成了知识库。分块比向量模型更先决定成败坏分块示例在句子中间砍断或一块里混了三个无关主题。入门够用的规则策略说明按标题切Markdown 的##/###天然边界按段落 长度上限例如每块 300800 字块间重叠 50100 字保留来源每块带source文件名heading重叠overlap是为了避免答案刚好落在切缝上。本篇示例按##标题切块简单、可读、好调试。召回先关键词再谈向量向量库embedding 近似最近邻适合「用户说法和原文用词不一致」的语义检索。但学习阶段更建议1. 先用关键词 / 简单打分跑通闭环本篇做法2. 用真实问题测「召回率」该出现的段落有没有进 Top-K3. 召回仍差再换 embedding 或混合检索关键词 向量本篇打分逻辑可解释、零额外依赖score 标题命中权重 正文词项命中次数 取 Top-K默认 3块返回以后换成余弦相似度Agent 侧工具签名可以不变——这才是干净的分层。「检索到了」不等于「答对了」还要在 Prompt 里立规矩接第 04 篇操作系统1. 只根据提供的片段回答片段不足就说「资料不足」禁止编造2. 引用出处文件名 / 标题3. 冲突时列出冲突不要擅自抹平没有这三条RAG 只是「更像有依据的幻觉」。完整示例读你自己的笔记knowledge/*.md示例知识库可换成你的笔记启动时分块建内存索引Agent 工具search_knowledge→ Top-K 片段多轮问答强制引用出处索引结构type Chunk { id: string; source: string; // 文件名 heading: string; // ## 标题 text: string; // 块正文 };检索工具给模型看的说明书{ type: function, function: { name: search_knowledge, description: 从本地知识库检索相关笔记片段。回答产品、流程、个人笔记类问题前必须调用。返回 Top-K 块及来源。, parameters: { type: object, properties: { query: { type: string, description: 检索问句或关键词 }, topK: { type: number, description: 返回条数默认 3 }, }, required: [query], }, }, }试玩你我们退款流程最长多久依据是什么 你出差杭州的差旅标准是多少 你知识库里有没有写 Agent 系列的更新节奏你应在 Observation 里看到具体source/heading最终答复应点名出处。把knowledge/换成你自己的 Markdown 后这就是「读你笔记的知识 Agent」最小版。和全量塞上下文怎么选同题对比假设知识库合计约 2 万字全塞RAG Top-3每次请求 token接近全文通常只有数百两千字噪声高相对低若召回准漏检风险低都在上下文里有召回失败则必错运维几乎无要维护分块与索引文档短且必须零漏检 → 倾向全塞或「读整文件」工具。文档长、问题局部 → 倾向 RAG。两者之间 → 先关键词检索工具再决定要不要向量化。升级路径本篇之后你才需要按痛点加不要一次性堆栈1. 召回差用词不一致 → 上 embedding 向量库或托管检索2. Top-K 里噪声多 → 加重排rerank或让模型先筛片段3. 索引要增量更新 → 文件监听 / 定时重建4. 权限 → 按用户过滤可检索范围第 12 篇安全清单会再提Agent 框架第 09 篇往往内置 RAG 组件你现在手搓一遍以后才知道框架帮你藏了什么。常见踩坑坑现象处理块太大检索准但上下文爆炸缩小块、降 Top-K块太碎答案被切散增大块或加 overlapquery 太短召回飘让 Agent 先改写查询再搜可多一轮不引用出处无法验收输出契约强制来源...空结果仍硬答幻觉Observation 含hits:[]时 Prompt 要求承认不足把聊天记忆当知识库概念混乱偏好 → 05文档知识 → 07本篇小结1. RAG 检索相关片段 约束下生成解决私有知识与上下文长度问题。2. 先判断该不该上文档少就塞上下文词明确就关键词工具量大且语义开放再上完整 RAG。3. 分块与 Prompt 约束往往比「换更贵的向量模型」更管用。4. 对 Agent 而言RAG 通常是一个或一组检索工具仍跑在 Tool Loop 里。练习1. 删掉知识库里某一段关键句问原问题确认 Agent 会说「资料不足」而不是编造。2. 把topK从 3 改成 1观察答案变脆还是变干净。3. 新增一篇故意用词不同的笔记同义改写用当前关键词检索是否召回——体会何时该上向量。下一篇预告08工具设计比提示词更重要检索工具返回什么字段、错误怎么写、粒度多粗会直接决定 Agent 聪不聪明。下一篇把「好工具 / 烂工具」对照着改一遍。配套代码系列《AI Agent 开发从 0 到 1》· 第 07 / 12 篇 · TypeScript DeepSeekhttps://github.com/chenjiaobin/min-agent.git想入门 AI 大模型却找不到清晰方向备考大厂 AI 岗还在四处搜集零散资料别再浪费时间啦2026 年AI 大模型全套学习资料已整理完毕从学习路线到面试真题从工具教程到行业报告一站式覆盖你的所有需求现在全部免费分享扫码免费领取全部内容​一、学习必备100本大模型电子书26 份行业报告 600 套技术PPT帮你看透 AI 趋势想了解大模型的行业动态、商业落地案例大模型电子书这份资料帮你站在 “行业高度” 学 AI1. 100本大模型方向电子书2. 26 份行业研究报告覆盖多领域实践与趋势报告包含阿里、DeepSeek 等权威机构发布的核心内容涵盖职业趋势《AI 职业趋势报告》《中国 AI 人才粮仓模型解析》商业落地《生成式 AI 商业落地白皮书》《AI Agent 应用落地技术白皮书》领域细分《AGI 在金融领域的应用报告》《AI GC 实践案例集》行业监测《2024 年中国大模型季度监测报告》《2025 年中国技术市场发展趋势》。3. 600套技术大会 PPT听行业大咖讲实战PPT 整理自 2024-2025 年热门技术大会包含百度、腾讯、字节等企业的一线实践安全方向《端侧大模型的安全建设》《大模型驱动安全升级腾讯代码安全实践》产品与创新《大模型产品如何创新与创收》《AI 时代的新范式构建 AI 产品》多模态与 Agent《Step-Video 开源模型视频生成进展》《Agentic RAG 的现在与未来》工程落地《从原型到生产AgentOps 加速字节 AI 应用落地》《智能代码助手 CodeFuse 的架构设计》。二、求职必看大厂 AI 岗面试 “弹药库”300 真题 107 道面经直接抱走想冲字节、腾讯、阿里、蔚来等大厂 AI 岗这份面试资料帮你提前 “押题”拒绝临场慌1. 107 道大厂面经覆盖 Prompt、RAG、大模型应用工程师等热门岗位面经整理自 2021-2025 年真实面试场景包含 TPlink、字节、腾讯、蔚来、虾皮、中兴、科大讯飞、京东等企业的高频考题每道题都附带思路解析2. 102 道 AI 大模型真题直击大模型核心考点针对大模型专属考题从概念到实践全面覆盖帮你理清底层逻辑3. 97 道 LLMs 真题聚焦大型语言模型高频问题专门拆解 LLMs 的核心痛点与解决方案比如让很多人头疼的 “复读机问题”三、路线必明 AI 大模型学习路线图1 张图理清核心内容刚接触 AI 大模型不知道该从哪学起这份「AI大模型 学习路线图」直接帮你划重点不用再盲目摸索路线图涵盖 5 大核心板块从基础到进阶层层递进一步步带你从入门到进阶从理论到实战。L1阶段:启航篇丨极速破界AI新时代L1阶段了解大模型的基础知识以及大模型在各个行业的应用和分析学习理解大模型的核心原理、关键技术以及大模型应用场景。L2阶段攻坚篇丨RAG开发实战工坊L2阶段AI大模型RAG应用开发工程主要学习RAG检索增强生成包括Naive RAG、Advanced-RAG以及RAG性能评估还有GraphRAG在内的多个RAG热门项目的分析。L3阶段跃迁篇丨Agent智能体架构设计L3阶段大模型Agent应用架构进阶实现主要学习LangChain、 LIamaIndex框架也会学习到AutoGPT、 MetaGPT等多Agent系统打造Agent智能体。L4阶段精进篇丨模型微调与私有化部署L4阶段大模型的微调和私有化部署更加深入的探讨Transformer架构学习大模型的微调技术利用DeepSpeed、Lamam Factory等工具快速进行模型微调并通过Ollama、vLLM等推理部署框架实现模型的快速部署。L5阶段专题集丨特训篇 【录播课】四、资料领取全套内容免费抱走学 AI 不用再找第二份不管你是 0 基础想入门 AI 大模型还是有基础想冲刺大厂、了解行业趋势这份资料都能满足你现在只需按照提示操作就能免费领取扫码免费领取全部内容​2026 年想抓住 AI 大模型的风口别犹豫这份免费资料就是你的 “起跑线”