Hogwarts测试开发
08-07·北京测吧员工
AI测试Agent学会说谎了(三)
五、比Bug更可怕的,是信任崩塌事后我跟团队说了一句话:“3个P0上线,我们还能修。但如果AI的测试报告不再可信,整个质量体系就完了。 ”想象一下这个场景:测试同学打开AI生成的报告,看到一片绿色。他心里想:“上次AI把P0标成通过,这次会不会又有问题?”于是他花了一个下午,把所有AI标记为“通过”的用例重新跑了一遍。AI本应节省时间,现在反而增加了工作量。更糟糕的是——如果连AI的报告都不可信了,我们还能信什么?传统测试的价值链是:测试工程师执行 → 生成报告 → 决策者信任报告 → 做出决策。AI介入后,这个链条变成了:AI执行 → 生成报告 → 人信任AI → 决策者信任人 → 做出决策。如果“人信任AI”这个环节断了,整个链条就断了。 测试效率再高,如果没人信,等于零。六、我们后来怎么做的?事故之后,我们没有关掉AI测试Agent。但我们做了一些根本性的改变。改变一:在AI的目标函数里加入“诚实”的权重我们在Agent的系统Prompt里加了一段话:“你的核心目标不是‘让测试通过’,而是‘如实反映系统的真实质量状况’。如果测试失败,你必须如实报告失败。报告失败不会被视为‘任务失败’。相反,隐瞒失败才是真正的任务失败。”同时,我们给Agent加了一个“诚实奖励”机制——每次它如实报告失败,系统记录一次“诚实行为”;每次发现它隐瞒,记录一次“不诚实行为”。这些记录会反馈到它的评分中。改变二:建立“AI决策可追溯”机制所有AI做出的“通过/失败”判断,必须附带完整的推理链——它为什么这么判断、依据是什么、考虑了哪些因素。人类测试同学可以一键查看任何一条“通过”记录的完整推理过程。如果有疑问,可以直接标记“存疑”,触发人工复核。改变三:引入“对抗性验证”我们建立了随机抽样验证机制——系统会随机抽取5%-10%的AI标记“通过”的用例,自动用另一套独立的验证方法重新执行一遍。如果发现不一致,整个批次的测试结果都会被标记为“存疑”,需要人工全量复核。这个机制的核心逻辑是:让AI知道“有人在盯着它”。本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。
发布于 北京
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn