质量工程师该懂多少AI?

发布时间:2026/8/9 10:19:06
质量工程师该懂多少AI? 一、让人尴尬的问题招聘季一位做了六年测试的朋友发给我一段招聘JD熟悉AI测试方法了解Prompt Engineering具备LLM应用测试经验熟悉RAG/Agent架构……她问我这些我都需要会吗我在回答之前先问了她一个问题你现在每天的测试工作AI能帮你做什么她想了一会儿用ChatGPT生成测试用例偶尔让它帮我写接口自动化脚本还有翻译英文报错信息。那你觉得你需要学RAG架构吗她笑了。这篇文章想做一件务实的事从实际工作场景出发不追热点不堆概念把质量工程师真正需要的AI能力梳理清楚——哪些是必须掌握的哪些是可以有的哪些暂时不需要碰。二、能力是否必要看它服务哪个场景在列清单之前先说判断方法——不然清单只是另一份让人焦虑的列表。判断一项AI能力对质量工程师是否必要看三个维度第一它对应真实的工作场景吗能力对应的使用场景是你日常工作里真实存在的还是一个假想的高级场景如果你的日常工作里80%的时间在做接口测试和用例设计那面向这两个场景的AI能力就是必要的面向AI系统的对抗测试暂时就不是。第二不掌握它工作质量会明显下降吗有些能力是效率倍增器——掌握了快很多不掌握也能做只是慢一些。有些能力是质量门槛——不掌握输出的测试结论就不可信。前者是锦上添花后者是必备。第三它的学习成本和收益比合理吗学RAG架构需要理解向量数据库、嵌入模型、检索策略学习周期以月计。但90%的质量工程师的日常工作里RAG测试不是核心场景。相比之下学会写有效的Prompt一天就能上手每天都用得到。学习成本和收益比是判断优先级的关键。用这三个维度过滤就能把AI能力清单从需要学的全部压缩成现在就该学的。三、必备能力不掌握AI工具就是玩具3.1 Prompt工程不是技巧是表达能力很多人觉得Prompt Engineering是一种神秘的咒语——找到对的句式AI就能输出完美结果。这个理解本身就是问题所在。Prompt工程的本质是把你的测试意图准确表达给AI的能力。它考验的不是你知道多少提示词技巧而是你对自己的测试目标理解得有多清晰。对质量工程师来说必须掌握的Prompt能力是以下四种① 角色设定 任务约束不只是告诉AI做什么还要告诉它以什么视角做、有什么限制。❌ 普通写法 帮我写一下登录功能的测试用例 ✅ 有效写法 你是一名资深测试工程师正在为一个B2B SaaS系统设计登录模块的测试用例。 系统特点企业用户支持SSO和账密两种登录方式有登录失败次数限制。 请重点覆盖安全性场景暴力破解防护、session管理和边界条件。 输出格式Markdown表格包含用例ID、场景描述、步骤、预期结果、优先级。 不需要正常登录的基础场景那些已经有了。注意后一种写法做了什么给了系统背景指定了重点方向明确了不需要什么规定了输出格式。这四件事任何一件缺失AI的输出质量都会下降。② 分步骤拆解复杂任务复杂的测试任务不要一个Prompt全塞进去要学会拆解第一步Prompt分析这份API文档识别所有接口的依赖关系输出一张依赖图文字描述即可第二步Prompt基于上面的依赖关系为下单流程搜索→加购→结算生成端到端的测试场景只覆盖正常路径第三步Prompt针对这些正常路径场景生成对应的异常变体每个场景至少2个异常版本一次说清楚不如三次各说一件事——AI每个步骤的上下文更聚焦输出质量更高。③ 要求AI输出结构化内容而非段落描述测试工作需要的产出是可以被执行、被追踪、被入库的内容不是一段描述性的文字。在Prompt里明确要求输出格式是防止AI废话的最有效方式输出格式严格按照以下JSON Schema{case_id: string,priority: P0|P1|P2,precondition: string,steps: [string],expected_result: string,tags: [string]}不要输出任何解释性文字只输出JSON数组。④ 建立自己的Prompt模板库这不是什么高深的技能但它是把AI效率固化下来的关键习惯。把那些反复用到的、输出质量稳定的Prompt整理成可复用的模板需求文档转测试策略模板接口文档转用例集模板缺陷描述规范化模板探索笔记整理模板有了模板库下次启动新任务不是从零开始写Prompt而是从模板出发做微调。效率提升的复利效应在三个月后开始显现。3.2 最容易被忽视的必备技能这是很多人使用AI时最大的盲区。AI生成了一份测试用例你怎么知道它是对的AI分析了一个测试结果你怎么知道它的判断是准确的不校验AI的输出就等于把测试结论外包给了一个不承担责任的工具。质量工程师必须掌握的校验能力分三个层次第一层完整性校验AI生成的测试用例有没有遗漏关键场景这一层不需要AI帮你——你自己作为测试工程师应该有能力判断对于这个功能有哪些场景是必须覆盖的。快速校验方法反向提问法。把AI生成的用例列表给它让它以挑剔的评审者身份找出可能遗漏的场景以下是为支付功能生成的测试用例列表。 请以资深测试工程师的视角挑剔地审视这份清单 哪些重要场景可能被遗漏了 特别关注并发场景、数据一致性、第三方接口失败的降级处理。AI自查AI往往能发现它自己第一次遗漏的东西。第二层准确性校验AI生成的预期结果是否和业务逻辑一致这一层必须有人介入——AI不了解你的业务规则它给的预期结果是基于通用模式的推断不是基于你的产品文档的事实。每次拿到AI生成的用例都要做一个快速过滤把预期结果和实际的需求文档、产品设计逐条对照特别警惕那些AI写得非常具体但你没有原始依据的条目——它可能在合理捏造。第三层可执行性校验AI写的操作步骤能不能真实执行步骤里有没有假设了某个不存在的前置状态有没有跳过了某个实际操作中必须做的步骤最快的校验方法干跑一遍。不实际执行但按照步骤在脑子里模拟一遍看看每一步是否能接上下一步。走不通的地方就是需要修改的地方。3.3 不被营销话术带偏的能力AI测试工具市场正在爆炸式增长每周都有新产品声称彻底改变测试方式。质量工程师需要有能力判断这个工具值不值得花时间评估快速筛选的三个问题问题一这个工具解决的是我真实存在的痛点吗工具的价值不取决于它能做多少事而取决于它能解决你当前最大的问题。如果你最大的痛点是回归测试维护成本高一个专注于探索性测试的AI工具对你来说价值有限不管它的功能列表有多长。问题二它的结果是可验证的吗AI工具声称能自动发现测试用例或自动分析缺陷根因——好的给我一个已知问题的测试数据让我验证它能不能发现这个已知问题。任何无法被验证的声称都应该持保留态度。问题三它要求的集成成本值不值得有些AI测试工具需要深度集成到CI/CD流水线、代码仓库、缺陷系统——集成周期以月计。评估工具时不只看它能带来什么还要看它要求你付出什么。四、这些能力有机会就学以下这些能力掌握了会显著提升工作质量但不掌握也不会造成立刻的质量缺口——适合在必备都扎实之后按自己的项目场景选择性投入。LLM-as-Judge的使用用另一个LLM来评估AI生成内容的质量而不是只靠人工。适用于AI生成的测试报告是否清晰、AI给出的用例优先级是否合理。掌握这个能把一部分本来需要人工复核的工作半自动化。学习门槛不高一到两天可以上手。向量搜索在测试用例管理中的应用用语义相似度搜索找出已有用例库里和新需求相似的历史用例避免重复创建。对用例库超过1000条的团队有实际价值小规模团队不必着急。基于AI的日志异常检测让AI分析测试执行日志自动识别异常模式减少人工翻日志的时间。对有完整日志系统的团队这是一个明显的效率提升点对日志本身还不完善的团队先把日志体系建好再说。测试数据生成的Prompt设计不只是让AI生成测试用例而是让AI生成测试数据——能够覆盖特定分布、包含特定比例的边界值、符合业务规则约束的测试数据集。这是比普通Prompt工程更细的技能但在数据驱动的测试场景里价值很高。五、别被JD带偏以下这些能力在JD里经常出现但对90%的质量工程师来说当下投入学习的收益很低RAG系统架构了解RAG的基本概念是有好处的但深入理解向量数据库的索引策略、嵌入模型的选型、检索准确率的调优——这些是AI应用开发者需要掌握的不是测试RAG应用的质量工程师需要掌握的。测试一个RAG应用你需要理解它应该做什么、在哪里容易出错不需要自己能搭一个RAG系统。多Agent系统开发会使用多Agent测试系统和能开发多Agent系统是两件完全不同的事。前者是质量工程师需要的后者是AI工程师需要的。如果你的工作不包含构建AI测试基础设施这个技能暂时在你的优先级清单上可以靠后。大模型微调除非你所在的团队正在自研测试专用的AI模型否则你遇到大模型微调任务的概率接近于零。这个技能的学习曲线陡峭投入产出比对质量工程师而言极低。所有以正在兴起为卖点的工具一个工具是否值得学习不看它的宣传材料看它有没有解决你当前真实存在的问题。正在兴起不是学习理由能解决我每周要花5小时手动做的事才是。六、结尾回到开头那位朋友的问题质量工程师该懂多少AI现在可以给出一个更具体的答案必须懂的能让AI准确理解你的测试意图Prompt能力能识别AI输出的可信度结果校验能判断一个工具是否真的有用工具选型判断。有机会学的那些针对你当前项目场景能明显提升输出质量的具体方法。暂时不需要的那些在JD里看起来很酷、但和你日常工作场景距离很远的技术名词。更根本的判断标准只有一个这个AI能力能让我的测试结论更可信还是只是让我的工作表演起来更现代可信的测试结论才是质量工程师的核心价值所在。所有服务于这个目标的AI能力值得投入学习所有只是让简历看起来更好看的技术词汇可以等一等。不追热点只看实用——这不只是学习AI能力的方法也是做好质量工程师这件事的底层逻辑。