Amy心语
07-20·测试·10年+
用AI Agent做自动化测试的踩坑实录
最近在团队里尝试用AI Agent替代部分自动化脚本的编写,跑了几轮试点,踩了一些坑,也有几点实实在在的体会,记录一下。第一个体会:Prompt工程比模型选型更值得花时间。刚开始我们花了不少精力在对比不同模型的代码生成能力,GPT-4、Claude、文心都试了一圈。后来发现,模型之间的差异远没有Prompt带来的差异大。同样一个模型,上下文给得清晰、示例选得对,脚本可用率能从40%左右直接拉到90%以上。换句话说,先让AI理解业务场景,比纠结用哪个模型更重要。第二个体会:自愈机制不是锦上添花,是刚需。AI生成的定位器看起来很合理,但一旦页面结构有变动,xpath一挂脚本就全废。我们后来加了一层自愈逻辑——定位失败时自动尝试相近元素匹配,配合重试策略。代价是执行时间增加了大概20%,但脚本的稳定性提升了一个量级,这笔账算下来是值得的。第三个体会:效果评估比想象中难得多。传统自动化测试的结果是确定的,对就是对,错就是错。但AI生成的东西,结果往往是“似是而非”的,传统断言完全不够用。我们现在用的是语义相似度打分+人工抽验的折中方案,谈不上完美,但至少能把90%的无效结果筛掉,把人工从重复劳动里解放出来。以上是最近的一点实践总结。AI在测试领域的落地还远没到成熟阶段,但方向我是看好的。同行里如果有也在做类似尝试的,欢迎交流,互相避坑。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中