华为踩过的四个大坑,做AI Agent的团队都该看看

发布时间:2026/8/19 9:09:33
华为踩过的四个大坑,做AI Agent的团队都该看看 本文整理自 AICon 上海 2026 张琦分享《华为云码道背后的Agent 的系统设计》通过AI音视频总结工具Ai好记进行转录整理以下为视频转文字整理后的会议笔记内容。从AI辅助研发到辅助AI研发理念变了问题也变了2021年GitHub Copilot横空出世2000万开发者、500万付费用户——AI辅助编程一夜之间从实验室走向了大众。但四年后华为的实践告诉我们真正让AI深度融入研发流程可远不止写个提示词那么简单。张琦华为云码道的核心开发者在AICon上海2026的演讲中分享了一个关键转变——从AI辅助研发到辅助AI研发。这句话不是文字游戏它代表着AI在研发流程中角色的根本性变化过去人写代码AI补全提示现在AI操作代码仓库人提需求、验收结果听起来很美好但华为在落地过程中踩了四个大坑每一个都值得所有正在做AI Agent的团队认真看看。坑一牵一发而动全身的跷跷板效应如果你觉得优化AI Agent就是改改提示词这么简单那你就太小看这件事了。张琦在演讲中举了三个真实的上线问题第一个内源地址。Agent不知道公司的内源地址装不上依赖。解决方案在系统提示词里写清楚。但公司内源有几十种pip、conda、poetry、mvn、npm……全部塞进去会导致提示词污染和膨胀Agent的通用性大打折扣。第二个代码不准确。让Agent写完代码后自我验证。结果呢简单任务本来不需要验证现在也要走一遍流程执行时间急剧恶化。第三个用了不安全函数。Agent生成的C/C代码使用了memset被认为不安全。禁用它但有些场景memset是合法使用的因噎废食反而会误判。这三个问题背后是一个共同的困境左边是代码正确性、安全合规右边是效率下降、提示词膨胀。你花大力气优化左边右边必然下滑。这就是跷跷板效应——优化Agent时核心指标之间天然冲突无法兼顾。坑二Agent系统就像混沌系统改一行代码可能引发连锁反应“Agent系统当中任何一点微小的改动都会在它多轮的模型交互之后引发非常大的连锁反应把之前非常小的一个错误不断地放大。”张琦的这个类比非常精准。Agent系统本质上是一个非线性系统你无法提前评估一个微小改动会带来什么影响。很多时候问题只有在Agent上线后通过用户反馈才能发现。后果是什么试错成本极高无法做天级迭代。在AI赛道日新月异的今天这几乎是致命的。坑三数据金矿摆在面前却不知道怎么挖华为内外有十几万用户每天产生海量数据。但问题来了用户反馈信号极弱——大部分人默认点接受你分不清他是真心觉得好还是懒得看Agent的轨迹数据虽然丰富但每个环节对不对、有没有用根本没法分析“相当于我们坐在了一个金矿上面却不知道怎么把这个金子挖出来。”——这句话说出了多少AI团队的痛点坑四推理成本高到离谱对比一下三种模式的成本Copilot模式简单补全几百Token对话模式几千到几万TokenWebCoding模式复杂重构40多万Token架构级修改200万到800多万Token两个数量级的差距1000倍的Token消耗差距。如果你的Agent要大规模落地成本问题不解决项目根本走不远。华为云码道的四套解法面对这四个坑华为给出了四个解决方案每一个都值得深入理解。解法一环境自适应Agent——按需实例化解决跷跷板效应华为的思路很巧妙不提供一个固定的Agent而是提供一个Agent类。当用户用Agent打开一个SpringBoot项目时系统根据代码特征检测到项目类型自动注入对应的SubAgents、Java代码库和SpringBoot技能。这样一来针对Java场景的专项优化就不会影响到前端场景。分而治之各场景独立优化跷跷板效应迎刃而解。解法二自动化评估与运营双循环——让数据真正转起来华为建了一个评测平台从Outcome最终结果和Trajectory执行过程两个维度评分。为什么既要看结果也要看过程因为Agent有自我纠错能力结果正确不代表过程没问题。评估循环每天发布新版本下班前丢给评测平台第二天分析Bad Case决定改工具、改提示词还是改Skill。运营循环用户的问题单抽象成评测集任务不断丰富评测集让Agent越用越好。解法三大小模型协同——用1/80的成本处理40%的任务华为发现约40%的任务非常简单小模型就能搞定。于是他们做了两件事基于规则分流session标题生成、提示词润色等简单任务路由到小模型基于模型分流训练一个小模型判断任务复杂度复杂用大模型简单用小模型效果如何128道题的测试中精度基本不变推理成本节约约25%。核心逻辑不是减少Token量而是把Token从昂贵的大模型转移到便宜的小模型上成本比1:80。解法四工具集深度优化——Harness工程50%的工作量都在这“优化工具的工作量大概占了整个Claude Code开发工作量的一半左右。”华为对Edit工具的优化堪称教科书级别包含了8道防错机制没读文件不准改防偷懒文件被改后不准改防时效问题old_string和new_string相同则提示防无效修改old_string出现多次则拒绝防大改改后还原编码和换行风格防编码乱改允许容错替换防白改改前检查权限防瞎改改后立即语法检查防错改给正在做Agent的团队几点建议张琦在演讲最后分享的几个观点我觉得特别有价值把AI当员工而不是工具。理念不转变技术再好也白搭。SubAgent要慎用。只在上下文不足、需要限制工具集、领域冲突或需要模型分流时使用。简单任务、完全委派、上下文依赖的场景别用。TDD测试驱动开发在AI时代潜力巨大。传统TDD推广难是因为开发者不愿写测试用例但AI可以代劳。测试用例无歧义、可执行、可自动化验收比自然语言规格更高效。Bash工具是双刃剑。它图灵完备、模型天生会用但极不安全。华为在Bash工具上投入了3000-4000行代码不是增强它而是限制它。Harness Engineering的约束能力会永久保留。增强模型的能力会逐渐被模型吸收但约束模型行为的能力会一直留在Harness层。以上内容由 Ai好记 转录整理。Ai好记是一款支持音视频转录、总结与翻译的AI学习助手支持解析B站、抖音、小宇宙等平台链接及本地音视频文件视频转文字后自动生成结构化总结要点、精华速览、思维导图和图文笔记帮助你把几小时的会议视频变成可搜索、可复习的结构化笔记。