霍格沃兹测试开发学社
07-10 · 北京测吧
AI 生成用例只是起点,真正的难点是 二
三、核心架构:生成、评估、修复、学习、优化的自进化闭环腾讯 PCG 的实践并不是简单地调用大模型生成一批用例,而是围绕用例质量构建了一套完整闭环。整体流程可以概括为:这套机制的关键点在于:AI 不只是生成者,也要进入评估、修复和学习流程。也就是说,系统不是一次性输出结果,而是通过多轮闭环,让生成结果不断向高质量用例靠近。四、评估引擎:自进化系统的“眼睛”用例生成之后,第一件事不是直接交给测试人员使用,而是先经过质量评估。在腾讯 PCG 的实践中,评估引擎采用了“规则检查器 + LLM 评估器”的双评估架构。其中:规则检查器占 70%LLM 评估器占 30%这个比例背后的设计思路非常清晰:规则保底线,LLM 提上限。规则检查器适合处理确定性问题,比如格式是否符合 BDD 规范、字段是否缺失、步骤是否完整、是否存在明显重复等。LLM 评估器则更适合处理语义类问题,比如场景覆盖是否充分、描述是否清晰、测试意图是否合理、是否存在隐性风险遗漏等。两者结合之后,可以让用例质量评估既有稳定底线,又保留一定的智能判断能力。评估维度主要覆盖五个方面:五、自循环修复:只重做低质量部分,而不是全量推倒重来传统 AI 用例生成中,一个常见问题是:只要某些结果不满意,就让模型重新生成一遍。这种方式看似简单,但问题也很明显:一方面,原本质量不错的内容可能被覆盖;另一方面,每次全量生成都会带来额外 Token 消耗,成本不可控。腾讯 PCG 的实践中采用的是局部修复策略:只重做评分低的部分,保留已经达标的高质量内容。修复流程分为三级:1. L1:规则自动修复适合处理格式类、结构类、字段类问题。例如:缺少前置条件BDD 格式不完整标题命名不规范重复字段清理描述格式统一这类问题可以通过规则快速修复,通常是秒级完成。2. L2:LLM 局部重生成适合处理语义类问题。例如:场景覆盖不足步骤描述不清晰断言不明确测试数据不合理某个子场景缺少边界条件此时不需要全量生成,只需要让 LLM 针对低分片段局部重写。3. L3:人工介入当系统判断置信度不足,或者规则与 LLM 评估结果存在明显冲突时,再引入人工介入。这样可以避免所有问题都丢给人,也避免所有问题都盲目交给模型。更重要的是,人工处理结果还可以反过来成为后续系统学习的信号。
发布于 北京
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn