:概念、区别、架构、落地全指南)
我们是由枫哥组建的IT技术团队成立于2017年致力于帮助IT从业者提供实力成功入职理想企业我们提供一对一学习辅导由知名大厂导师指导分享Java技术、参与项目实战等服务并为学员定制职业规划全面提升竞争力过去8年我们已成功帮助数千名求职者拿到满意的OfferIT枫斗者、IT枫斗者-Java面试突击。一、前言别被“超大上下文窗口”迷惑如今主流大模型的上下文窗口早已突破 1M Token很多开发者都会陷入一个普遍误区既然模型上下文窗口足够大直接把项目所有文档、日志、资料全部塞进上下文模型就能自动读懂、自动解决问题。但在真实的 AI Agent、企业级 RAG、复杂大模型应用落地场景中事实完全相反。市面上经常出现一种奇怪的现象同样的大模型、同样的 Agent 框架、同样的业务场景不同团队落地的效果天差地别。造成这种差距的核心原因并非模型能力、框架选型而是绝大多数人忽略了上下文工程Context Engineering。每一次 LLM 调用前上下文窗口内的内容取舍、信息排序、噪声清理、工具挂载、历史处理、格式规整对最终输出效果的影响远超 Prompt 话术优化。很多人误以为“大窗口好效果”但真正的工程落地逻辑是窗口大只是能装更多内容不代表能更好地利用内容。本文将近万字系统拆解上下文工程完整体系帮你彻底打通 AI 应用进阶的核心壁垒。读完本文你将完整掌握超大上下文窗口的隐性缺陷上下文失效、腐化的底层原理Context Engineering 与 Prompt Engineering 的核心本质、分工边界与落地差异工业级上下文组装全流程静态规则、动态信息、Token 预算、按需加载策略Compaction、结构化笔记、Sub-agent 三大方案解决长任务上下文腐化难题可落地的量化评估体系、场景选型标准、实操规范与高频避坑要点1.1 实战案例电商售后场景直观差距对比我们以最常见的电商售后场景为例直观展示「上下文不足」和「上下文充足」的效果差距看懂上下文的核心价值。用户原始输入“MD我上周买的耳机右耳没声音了怎么处理”场景一上下文缺失劣质 Agent 表现Agent 仅获取用户原始话术无任何业务数据、订单信息、售后规则、工具能力最终回复抱歉给您带来不便。请问您购买的是哪款耳机订单号是多少能否描述一下具体故障表现核心问题机械套用客服流程只会反问用户收集信息不会主动挖掘已有业务数据交互链路冗长、用户体验极差完全没有体现智能化能力。哪怕使用 GPT-5.5、Claude 顶配模型依旧只能被动问答。场景二上下文充足优质 Agent 表现在调用 LLM 之前系统提前完成多源业务数据拉取、工具挂载、状态校验为模型组装完整上下文订单系统查询用户 3月25日 下单索尼 WH-1000XM5耳机为上周订单售后规则查询商品处于 7天无理由退换有效期内符合换货条件用户工单查询该用户为平台老客户无历史售后纠纷、信用良好工具能力挂载加载create_return_order发起换货、check_inventory库存查询工具实时库存校验同款耳机仓库有现货可正常发货。基于完整上下文Agent 直接给出解决方案无需反问用户您好查到您 3 月 25 日购买的索尼 WH-1000XM5目前仍在退换质保期内。我这边可以直接帮您发起换货申请仓库当前有同款现货预计 2-3 天即可寄出新品。需要我帮你直接操作吗场景总结上下文是大模型的信息底座与能力上限上下文缺失、杂乱时顶配模型也只能靠猜测、反问推进任务上下文精准、充足、干净时中等参数模型也能高效解决复杂业务问题。补充说明上下文不是影响 Agent 效果的唯一因素工具设计、任务拆解、状态管理、结果验证同样关键但上下文是所有能力生效的前置基础上下文失效后续所有优化都无从落地。二、什么是 Context Engineering上下文工程2.1 行业权威定义来自行业大佬 Tobi Lutke 的经典定义the art of providing all the context for the task to be plausibly solvable by the LLM精准翻译上下文工程是为大模型提供完备、精准、有效的上下文信息让任务在模型能力范围内具备可解性的工程方法。核心关键词plausibly具备可能性上下文不是万能解药无法让模型突破自身能力上限但缺失合规的上下文任务从根源上就不具备解决的可能性模型只能凭空幻觉、无效反问。2.2 通俗类比与核心定位为了快速理解二者差异我们用两个经典类比精准区分上下文工程与提示词工程厨房类比最通俗Prompt Engineering提示词工程告诉厨师怎么做菜定义菜品做法、口味、格式、要求Context Engineering上下文工程帮厨师整理整个厨房规整食材、分类调料、摆放工具、张贴参考标准搭建完整、有序的工作环境。操作系统内存类比最贴合工程本质大模型的上下文窗口本质就是LLM 的工作内存。Context Engineering 就是大模型专属的内存管理体系核心职责管控内存加载哪些信息必须加载、哪些信息禁止进入管控信息生命周期何时写入、何时展示、何时淘汰管控内存溢出窗口满载时通过摘要、优先级、LRU 策略做内容置换和操作系统页面置换逻辑完全一致。2.3 Context Engineering 六大核心管控模块上下文工程管控每一次 LLM 调用窗口内的所有信息覆盖静态规则、动态数据、工具、记忆、格式、Token 全维度具体分为六大模块System Prompt 静态规则属于 Agent 的“出厂固定配置”不随单次对话变化。包含角色定位、任务目标、行为约束、执行流程、输出格式、安全规则。常见固化载体.cursorrules、.claude/rules、AGENTS.md。User Prompt 业务指令用户实时输入的自然语言、业务参数、附件内容、临时指令。需要做脏数据清洗、格式规整、无效内容剔除避免杂乱输入污染整体上下文。Memory 记忆体系分为短期记忆和长期记忆短期记忆为会话内滑动窗口的历史对话长期记忆包含文件、KV 存储、关系数据库、图数据库、向量知识库。核心管控记忆的写入、更新、遗忘、召回、上下文注入规则。RAG Tools 能力层RAG 负责从外部知识库检索关联内容并注入上下文Tools 包含工具描述、调用参数格式、工具执行结果Observation。RAG 本质是上下文工程的核心落地形态之一。Structured Output 结构化约束包含 JSON Schema、Function Calling 参数规范、输出格式约束、字段校验规则。这类元约束会随每次调用注入上下文强制规范模型输出形态避免解析失败。Token 优化体系包含历史内容摘要压缩、无效信息剔除、上下文缓存Context Caching、内容优先级裁剪。核心目标严控 Token 成本同时最大化保留有效业务信息。三、核心区分Context Engineering vs Prompt Engineering绝大多数开发者都会混淆这两个概念甚至将上下文优化归为提示词工程的分支。但在工业级落地中二者核心目标、工作维度、迭代逻辑、落地价值完全不同是两套相辅相成、不可替代的独立体系。对比维度Prompt Engineering提示词工程Context Engineering上下文工程核心关注点指令本身措辞、语气、句式、格式、逻辑、样例信息供给窗口内容取舍、排序、加载时机、清理规则、信噪比核心目标让模型听懂指令、遵守规则、按要求输出为模型补齐解题所需的全部有效信息解决信息缺失问题作用范围单次指令优化、话术打磨、Few-shot 样例配置全生命周期静态规则、历史对话、外部检索、工具、记忆、Token 管控变更频率相对固定迭代以优化话术、补全规则为主动态实时变化每一轮 LLM 调用都会重新组装、裁剪、排序上下文核心能力依赖语言表达、逻辑梳理、样例编排能力工程架构、数据检索、内存管理、压缩算法、状态调度能力落地层级业务话术层、指令层底层信息底座、运行时架构层终极分工总结Prompt Engineering解决「模型不知道怎么做」的问题Context Engineering解决「模型没有信息可以做」的问题。四、上下文为什么会失效长窗口的隐性陷阱所有开发者都要摒弃一个核心误区上下文窗口越大模型效果越好。真实落地中长上下文存在严重的边际收益递减盲目堆砌内容反而会导致模型准确率下降、幻觉增多、关键信息遗漏。4.1 两大经典负面现象**Context Rot上下文腐化**现象上下文内容越长、信息越杂乱重复、过期、无关、冗余内容越多有效信息的占比信噪比持续降低模型筛选有效信息的稳定性大幅下降最终被噪声干扰输出错误结果。Lost in the Middle中间信息丢失现象大模型的注意力机制存在固有特性对上下文头部、尾部内容敏感度最高、权重最大对段落中间的关键约束、核心数据、限制条件极易忽略。哪怕关键信息已经写入上下文模型依然会“视而不见”这也是很多人“给了资料却答错”的核心原因。4.2 底层原理Transformer 注意力机制逻辑大模型不会像人类一样逐行阅读、逐字理解文本而是依靠Attention 注意力机制为上下文内的每一个 Token 做相关性打分重点关注高分内容、忽略低分内容。短上下文场景干扰项极少注意力权重可以精准聚焦任务相关的核心信息判断准确率高超长上下文场景Token 数量指数级增长候选信息海量噪声内容大量抢占注意力权重模型筛选关键信息的难度呈倍数提升补充说明现代长上下文模型通过稀疏注意力、分块处理、上下文缓存等技术优化但无法彻底解决长文本信息筛选难的问题只能缓解退化程度。4.3 边际收益递减能装下 ≠ 能用好长上下文的核心悖论模型可以加载百万级 Token 内容但无法稳定利用百万级 Token 内容。类比开卷考试你携带的复习资料越多不代表答题越准。海量杂乱的资料会让你找不到核心考点反而耽误答题。同理将项目文档、全量日志、会议记录、历史对话、冗余资料全部塞进上下文关键业务约束会被海量噪声淹没。4.4 上下文工程的核心优化思路上下文工程从不追求“塞更多内容”而是追求“放对内容”核心目标是提升上下文信噪比具体落地手段主动清理删除重复、过期、无关、无效的噪声内容权重优化将关键规则、业务约束、核心证据前置放在高优先级位置长文本处理超长文档先切分、摘要、精准检索禁止全文硬塞信息分层将任务目标、业务背景、约束条件、输出格式清晰拆分关键标记对核心事实、硬性约束做特殊标记减少模型猜测空间。核心原则长上下文不是垃圾桶而是工作台。宁愿上下文精简、高纯度、高信噪比也绝不堆砌海量低价值噪声信息。五、上下文工程的量化评估体系上下文优化绝对不能依靠主观体感很容易出现“看起来更智能实际成功率下降、成本上升”的假象。必须建立可量化、可复现、可对比的评估指标精准衡量优化效果。5.1 五大核心评估指标指标类型具体评估维度任务成功率核心目标完成率、人工补救率、成功路径可复现性、任务闭环率工具调用质量工具错选率、漏调率、参数错误率、重复调用率、危险操作拦截率上下文成本输入/输出 Token 消耗量、上下文缓存命中率、摘要压缩信息保留率延迟指标首 Token 延迟、端到端整体耗时、工具等待耗时、P95/P99 响应延迟结果质量幻觉发生率、证据引用准确率、摘要信息丢失率、关键字段遗漏率5.2 标准评测落地流程样本搭建选取 20~50 条真实业务任务轨迹搭建专属评测数据集单一变量迭代每次仅修改一项配置检索策略、摘要规则、工具描述、Prompt 等避免多变量干扰指标对比对比修改前后的全套指标精准定位优化效果或退化问题持续迭代基于评测结果逐步调优上下文组装、压缩、检索规则。六、运行时上下文三种加载策略与场景选型上下文的动态加载策略直接决定复杂 Agent 任务的准确率和稳定性。工业级落地主要分为三种策略预检索、按需加载、混合策略不同场景有明确的选型标准。6.1 传统方案预检索Pre-retrieval实现逻辑在 LLM 调用之前一次性通过 Embedding 语义检索、关键词检索拉取所有“疑似相关”的内容全部注入上下文窗口再执行模型推理。核心优点实现简单、技术链路稳定、响应速度快、无需复杂工具调度。致命缺陷静态检索仅能基于「调用前的已知信息」检索无法适配 Agent 运行中动态产生的新线索、新问题噪声泛滥为了不漏掉信息会大量拉入低相关度内容大幅降低上下文信噪比。适用场景简单 FAQ 问答、固定知识库咨询、内容稳定的文档审阅场景。6.2 进阶方案按需加载Just-in-Time / 渐进式披露代表落地产品为 Claude CodeAnthropic 官方命名为Progressive Disclosure渐进式披露是复杂长任务的核心方案。实现逻辑初始轻量化启动仅加载文件路径、目录结构、数据库地址、链接、时间戳等元数据不加载完整内容运行时动态拉取Agent 执行过程中根据当前任务进度、推理线索需要什么内容就动态调用工具拉取什么内容元数据辅助决策通过文件路径、大小、修改时间等元数据辅助 Agent 判断信息优先级与语义归属。核心优点上下文极致干净、证据精准、噪声极少高度贴合人类排查问题、开发迭代的工作模式。核心缺点工具调用次数增多、整体响应延迟偏高极度依赖 glob、grep、tree 等优质导航工具工具能力不足会导致任务卡壳、走偏。适用场景大型代码库分析、线上故障排查、开放式研究探索类任务。6.3 生产主流方案混合策略预检索和按需加载各有优劣工业级复杂 Agent 统一采用混合策略兼顾启动速度与运行灵活性静态确定性知识全局规则、基础文档、固定知识库使用预检索提前加载保证启动速度动态不确定性内容运行线索、临时数据、深层业务逻辑使用按需加载动态拉取保证上下文精准。6.4 三种策略全方位对比与选型标准加载策略优点代价适用场景预检索实现简单、响应快、链路稳定易引入噪声、运行时灵活性差FAQ问答、固定知识库、静态文档审阅按需加载上下文纯净、证据精准、灵活性强工具调用多、延迟高、依赖优质导航工具代码分析、故障排查、开放式研究混合策略兼顾启动速度与动态探索能力需要预算管理、工具调度能力复杂业务Agent、长流程任务、多源检索场景选型四要素上下文是否稳定、任务探索空间大小、实时性要求、证据是否需要可追溯。七、长任务解决方案三大武器抵抗上下文腐化跨多轮、跨小时的长周期任务对话历史、工具日志、中间结论、检索内容会持续累积上下文必然不断膨胀、腐化。行业主流有三套成熟解决方案可单独使用也可组合搭配适配复杂场景。7.1 Compaction上下文压缩/摘要核心思路当上下文 Token 数量接近模型窗口上限时自动触发压缩逻辑调用 LLM 对历史会话、工具调用过程、中间日志做摘要重构保留核心决策、关键问题、重要结论剔除冗余交互、无效工具返回、重复内容用精简摘要开启新的上下文窗口接续任务。Claude Code 落地实现压缩保留项架构设计决策、未解决 Bug、核心实现细节、关键业务约束压缩剔除项重复工具调用日志、已完成的无效交互、冗余原始输出增量保留额外留存近期高频访问的核心文件保证任务无缝衔接。轻量化变种工具结果定时清理。工具执行完成、信息被模型消化后直接清空原始 tool_result 内容仅保留工具调用记录大幅降低 Token 占用。适用场景需要连续对话、流程连贯、无明确断点的长流程任务。7.2 Structured Note-taking结构化笔记核心思路模拟人类工程师的工作习惯让 Agent 主动将任务进度、已知问题、风险点、下一步计划、核心业务数据写入外部持久化文件如NOTES.md、待办清单。当上下文窗口重置、会话刷新后自动读取笔记内容接续之前的任务进度。经典案例Claude 运行宝可梦游戏在数千轮交互中自主维护角色数值、地图信息、战斗策略、任务进度笔记即便上下文多次重置依然可以跨小时持续推进任务。适用场景迭代式开发、有明确里程碑、分步推进、阶段性迭代的长周期任务。7.3 Sub-agent子代理拆分核心思路采用主从多代理架构**主代理Orchestrator**仅负责任务拆分、调度分发、结果汇总、最终决策将信息量大、探索复杂、流程繁琐的子任务委派给独立子代理执行。子代理可以独立加载海量上下文、执行多轮工具调用、完成复杂探索但最终仅向主代理返回高密度精简摘要结果详细的探索过程、冗余日志全部隔离在子代理内部主代理上下文始终保持干净轻量化。适用场景复杂学术研究、并行多分支探索、批量任务处理、需要多方结果汇总的复杂场景。7.4 三大方案选型对照表技术方案核心优势最佳适用场景Compaction 摘要压缩保持对话连贯性无缝接续上下文无任务断点连续交互的长流程会话、客服对话、持续排查任务结构化笔记持久化任务进度跨会话、跨重启不丢失状态迭代开发、里程碑式分步任务、长期项目跟进Sub-agent 子代理隔离复杂子任务支持并行执行主上下文零冗余大型研究、多分支探索、批量复杂任务汇总八、完整落地流程Context Assembler 上下文组装器工业级上下文工程的核心落地载体是Context Assembler上下文组装器每一次 LLM 调用前都会执行一套标准化、可复用的组装流程彻底告别“无脑塞内容”的粗放模式。8.1 全流程伪代码生产标准# 输入用户任务、当前会话状态、业务上下文input:user_task,session_state,business_context# 1. 加载静态系统约束角色、规则、权限、输出格式、安全边界constraintsload_system_constraints()# 2. 提取当前轮次核心执行目标过滤无效用户输入goalextract_current_goal(user_task,session_state)# 3. RAG 精准检索拉取与当前目标匹配的文档、业务数据、知识库证据evidenceretrieve_rag(goal,business_context)# 4. 读取记忆体系短期会话历史 长期外部记忆过滤过期无效记忆memoryrecall_memory(goal,session_state)# 5. 基于目标、证据、记忆筛选当前轮次必备工具集toolsselect_tools(goal,evidence,memory)# 6. 历史消息压缩精简冗余会话保留核心交互与决策historycompact_history(session_state.messages)# 7. 上下文优先级排序核心信息前置规避 Lost in the Middle 问题contextrank([constraints,goal,evidence,memory,tools,history])# 8. Token 预算裁剪按优先级取舍内容严格匹配模型窗口上限contextfit_token_budget(context)# 输出最终可直接调用的消息体、工具Schema、溯源元数据output:messages,tool_schema,metadata8.2 两大核心关键步骤解析rank 优先级排序利用模型「头部信息权重更高、记忆更深」的特性将系统约束、当前核心目标、安全规则等高优先级内容固定前置历史对话、参考资料、次要信息后置从根源解决关键信息被遗漏的问题。fit_token_budget 预算裁剪严格按照预设优先级执行内容取舍高优先级核心内容完整保留原文中优先级内容精简摘要低优先级冗余内容直接剔除在 Token 预算内最大化保留有效信息。核心避坑点禁止“检索到什么就塞什么、历史消息能放多少放多少”的粗放模式无序的上下文堆砌是 Agent 效果差、幻觉多的首要原因。九、各模块实操规范与高频避坑指南9.1 静态 System Prompt 编写规范System Prompt 是 Agent 的底层行为准则建议采用结构化 Markdown 分模块编写拒绝大段无分隔、无逻辑的堆砌文本。标准结构角色定位 → 核心约束 → 执行流程 → 输出格式。实操示例故障排查 Agent 系统规则## 角色 你是后端服务故障排查专家擅长通过监控指标、日志信息定位服务异常根因。 ## 约束 - 仅调用必要工具禁止重复调用同类型工具 - 检索到关键证据后立即停止搜索输出结论 - 优先使用实时数据判断不依赖过期历史数据推断 - 禁止无依据猜测所有结论必须有日志/监控证据支撑 ## 执行流 1. 优先查询 CPU、内存、网络、QPS 核心监控指标 2. 检索异常时间范围的应用日志、错误栈信息 3. 存在异常则追踪调用链与上下游服务依赖 4. 整理证据输出结构化排查报告与修复方案 ## 输出格式 统一使用 JSON 格式固定字段incident_summary, root_cause, evidence, recommendation两大致命误区过度设计将大量业务 if-else 硬编码进 Prompt导致规则臃肿、维护成本极高边缘场景依然失效过度抽象仅写“做一个乐于助人的智能助手”无约束、无流程、无规范模型行为完全不可控。最佳实践先搭建最小可用基线版本基于线上失败案例逐条补充、迭代优化规则持续调校不追求一步到位。9.2 工具上下文编写规范工具描述的核心不是“写得详细”而是边界清晰必须明确回答两个核心问题当前场景什么时候该调用该工具什么时候绝对不能调用三条落地准则单一职责一个工具只负责一件事禁止“大而全”多功能工具避免模型选择困难参数示例核心参数补充标准格式样例降低模型参数解析错误率边界标注清晰写明工具适用场景、禁用场景、调用前置条件。9.3 动态上下文RAG/记忆/工具结果处理规范短期会话记忆采用滑动窗口做数量限制自动淘汰早期无效对话长期外部记忆读取后标记来源、生成时间、可信度区分新旧信息杜绝记忆污染工具执行结果故障排查、问题分析场景必须保留 traceId、错误码、日志位置等溯源信息不可只留摘要普通场景可精简降噪。高频故障兜底方案故障类型典型表现兜底优化策略RAG 无结果检索无匹配文档、召回片段零散无效降级关键词检索必要时主动向用户确认信息缺口工具超时外部API阻塞、工具无响应、Agent无限等待设置超时阈值、重试上限、熔断机制预留人工接管入口摘要丢失证据压缩后丢失异常栈、版本号、关键边界值强制保留关键字段、原始证据链接与溯源标识记忆过期污染旧状态、旧配置被当作当前有效事实记忆写入前校验有效性读取后标记时间戳与可信度9.4 Few-shot 示例使用规范Few-shot 样例可以有效引导模型行为但绝大多数人都存在滥用问题堆砌数十条边缘案例导致模型过度拟合表面格式忽略核心业务逻辑。标准落地方式仅选取3~5 个典型标准化场景样例展示通用处理策略与逻辑不堆砌边缘 case让模型学习“解题思路”而非“固定格式复刻”。9.5 Token 预算优先级划分规范单次 LLM 调用内严格按照优先级分层管理内容窗口溢出时从低到高依次裁剪保障核心逻辑不丢失。优先级等级包含内容标准处理方式最高优先级固定区系统约束、任务目标、安全边界、核心规则永久保留绝不裁剪、压缩中高优先级动态加载当前任务工具描述、Schema、核心样例按任务阶段动态加载/卸载保障当前任务可用中优先级可精简RAG 参考资料、近期工具执行结果二次摘要精简保留核心内容与溯源链接最低优先级可折叠早期历史对话、已完成任务日志全文压缩摘要超限直接剔除补充优化支持上下文缓存的模型可将固定 System Prompt、通用工具描述设为缓存前缀大幅降低 Token 成本与首包延迟。十、配套技术栈与工具选型指南上下文工程落地无需堆砌全家桶可根据项目规模按需选型轻量化项目精简部署企业级项目完整搭建Agent 编排框架LangChain、LangGraph核心负责 Agent 控制流、状态管理、任务循环、工具调度RAG 数据框架LlamaIndex侧重文档解析、索引构建、检索优化、知识库治理向量数据库本地测试选用 Chroma企业级生产选用 Qdrant、Milvus、Weaviate、Pinecone记忆层产品Mem0、LETTA(MemGPT)、ZEP封装记忆的写入、检索、更新、遗忘全生命周期通信协议MCPAI 生态通用工具接入协议标准化资源、提示词、工具调用能力统一接入规范。十一、落地核心原则与避坑总结信噪比优先于信息量摒弃“内容越多越好”的误区超大窗口不等于优质效果。优先打造「高精准、低噪声」的轻量化上下文寻找完成任务所需的最小高密度信息集。长任务必然存在上下文腐化长周期任务无法依靠原始对话历史维持效果必须组合使用 Compaction、结构化笔记、Sub-agent 多套方案主动对抗上下文老化、噪声累积。先跑通最小闭环再逐步复杂化遵循行业通用准则do the simplest thing that works。优先落地静态规则、工具规范、基础 RAG跑通业务基线出现瓶颈后再迭代压缩、记忆、多代理架构杜绝过度设计。可观测、可迭代是优化前提所有上下文优化必须配套日志、指标、评测集做到每一次改动都可量化效果拒绝主观体感优化。十二、全文总结与上手路径Context Engineering上下文工程是大模型应用从「Demo 可用」走向「生产稳定」的核心分水岭也是高阶 AI 开发与普通调参玩家的核心差距。它与 Prompt Engineering 的终极分工Prompt Engineering打磨指令话术、输出规范解决「模型不会做」的问题Context Engineering搭建完整信息供给体系解决「模型没信息做」的问题。无论模型上下文窗口扩展到百万还是千万 Token“装得下”永远不等于“用得好”。上下文工程的本质就是用工程化思维替代粗放的堆砌模式精细化管理每一次 LLM 调用的信息底座。新手最优上手路径第一步标准化 System Prompt、规范工具描述搭建稳定业务基线第二步接入精准 RAG 检索实现动态上下文补给第三步配置 Token 预算、摘要压缩解决窗口溢出与噪声问题第四步长任务出现瓶颈后迭代结构化笔记、Sub-agent 多代理架构第五步搭建量化评测体系持续迭代优化上下文策略。⭐️推荐:Offer训练营介绍Java 面试 后端通用面试八股文Java后端企业级实战面试Java后端校招算法学习