为啥每家都在做 Agent

发布时间:2026/7/22 15:00:22
为啥每家都在做 Agent 表面是为啥每家都在做 Agent底下其实是两层Agent 是不是为了放大模型特性​ 以及这种放大具体是怎么映射的​ 分开讲。一、先答动机为什么不同大模型都要做自己的 Agent不全是为了发挥模型特性那是后半段的事。前半段是生存逻辑模型本身变现路径太窄——API 按 token 收费天花板低Agent 是按任务/结果收费单价高一个量级。对标竞品——OpenAI 有 Operator、Anthropic 有 Claude Code、Google 有 Astra/Jules不做就显弱势。锁生态——Agent 会沉淀工具链、MCP 服务、私有知识库迁移成本比换一个模型高得多。发挥自身模型特性确实是 Agent 设计时的核心考量——因为通用 Agent 架设在任意模型上都能跑但原厂 Agent 会把自家的长板做成默认路径让竞品模型即使套同一个 Agent 框架也打不过。二、Agent 特性 ↔ 大模型特性的直接映射关系挑几条最清晰的对应链讲配例子。 映射 1长上下文窗口 → 长程 Agent少检索、少摘要模型特性Kimi K3 的 1M token KDA 注意力长距离依赖不衰减。Agent 侧能做的事把对话历史 工具返回 中间规划整个塞上下文里不需要频繁做向量检索RAG也不需要用摘要压缩丢信息。例子Kimi 的长文档审阅 Agent——一份 80 万字并购合同从头读到尾Agent 在第 300 轮还能精确引用第 3 章第 5 条的措辞。换一个 32K 窗口的模型Agent 就得切 RAG 摘要跳数多了必丢上下文。 这里 Agent 的记忆管理策略是直接由模型上下文长度决定的——长窗口模型 Agent 可以懒汉式记忆全塞上下文短窗口模型 Agent 必须勤快式记忆向量库摘要压缩架构完全不同。 映射 2强推理 / 代码训练占比 → 编程 Agent 的自我纠错闭环模型特性Qwen3.8 激活 288B、代码语料占比高、多模态统一Claude 的 CoT 训练深度大。Agent 侧能做的事Agent 跑出报错 → 把 stack trace 喂回模型 → 模型能基于报错反推根因而不是瞎猜多轮修到过为止。例子Claude CodeAnthropic 的编程 Agent敢做跑测试→红→自动改→再跑的循环底气是 Claude 的 CoT 在代码调试链上不容易跑偏。小模型做同样 Agent经常改三轮就陷入同个错误反复试。⚠️ 这里有个阈值模型推理能力不到某个水位Agent 的反思Reflection模块就是摆设——它会假装反思其实在复读。 映射 3多模态原生融合 → 跨模态文档 Agent省掉 OCR/预处理链模型特性Qwen3.8、Gemini 1.5 是预训练期就图文混训不是 CLIP 外接。Agent 侧能做的事Agent 直接吞 PDF 扫描件 / 财务报表截图 / 工程图纸不需要外挂 OCR → 结构化 → 再喂文本这套脆弱 pipeline。例子阿里内部用 Qwen3.8 做的报销审核 Agent——用户拍一张餐饮发票照片 上传 Excel 明细Agent 自己看图对数字、对税号、对消费类型一步出结论。换纯文本模型这一整条 pipeline 得拆 3 个服务。 映射 4MoE 高稀疏 → 并发 Agent 集群成本侧映射模型特性Kimi K3 是 896 专家选 16单次激活参数很小。Agent 侧能做的事一个系统里并行跑几十个 Agent 实例每个 Agent 负责一个子任务算力账单不会炸。例子Kimi 技术报告里提到的多 Agent 协同写前端——一个 Agent 管布局、一个管组件、一个管样式三个 Agent 反复互评修改最后拼出一个完整页面。如果是稠密 2.8T 模型光跑一个实例都费劲别谈并发了。 映射 5函数调用Tool Use训练深度 → Agent 的工具编排复杂度模型特性GPT-4 / Claude 在函数调用格式遵循、多工具顺序决策上训练过fine-tune 专门做过 tool-call 数据。Agent 侧能做的事Agent 框架可以放心把十几个工具同时注册给模型让模型自己决定先调哪个、参数怎么填。例子OpenAI 的 Operator —— 模型自己决定先搜价格 → 再查库存 → 再填表单 → 再点提交四步工具链顺序模型自己排。换一个没做过 tool-use 训练的 base 模型套同样 Agent常见症状是工具参数填错、顺序颠倒、忘了调最后一个。三、反过来想是不是通用 Agent 任意模型就够了不是。通用 Agent 框架LangChain、AutoGPT 这类能做到 60 分但原厂 Agent 能吃透自家模型的脾气知道模型在哪类任务上容易幻提前加校验知道模型的 CoT 格式偏好prompt 不用通用模板知道模型的失败模式Reflection 模块针对性补。所以会看到一个有意思的现象——模型越强Agent 越轻Claude Code 核心逻辑很薄靠模型撑模型越弱Agent 框架越重拼命加规划、加校验、加人类确认来兜底。