霍格沃兹测试开发学社
06-25 · 北京测吧
微信“小微”内测刷屏(六)
十、AI 时代,测试最难的不是找 bug,而是验证“不确定性”传统测试面对的是确定性问题。比如:登录成功后是否跳转首页?商品价格是否计算正确?支付失败是否提示?接口返回码是否符合预期?这些都比较明确。但 AI 系统的问题往往是不确定的。比如用户说:“帮我把刚才那个文件发给他。”这句话里面至少有三个模糊点:“刚才那个文件”是哪一个?“他”是谁?“发”是发原文件,还是发总结,还是发链接?如果 AI 理解错了,可能会把文件发给错误的人。如果文件里有公司机密,后果就很严重。再比如用户说:“帮我总结一下这个群里和我有关的事情。”测试要验证什么?不仅要看总结准不准,还要看:AI 是否遗漏了重要信息是否把闲聊当成待办是否把别人的任务误判成你的任务是否读取了不该读取的历史记录是否把敏感内容暴露出来是否在不确定时主动说明是否提供可追溯依据这已经不是简单的功能测试。这是意图识别测试、上下文测试、权限测试、安全测试、AI 输出评估的组合题。十一、“小微”这类产品,会带来 7 类新的测试场景对测试从业者来说,微信“小微”最大的启发,是让我们提前看见未来企业 AI 系统的测试难点。1. 意图识别测试用户不会按照标准话术使用 AI。同一个需求,可能有无数种表达:“帮我总结一下这个文件。”“这个文件讲了啥?”“提炼一下重点。”“老板让我看这个,你帮我抓重点。”“我没时间看,直接告诉我结论。”测试要验证 AI 能不能识别不同表达背后的真实意图。更重要的是,当意图不清楚时,AI 能不能主动追问,而不是乱执行。2. 上下文理解测试AI 最容易出问题的地方,就是上下文。“刚才那个文件”“上次那个客户”“他刚说的事情”“按之前方案处理”这些话都依赖上下文。测试要验证:AI 取到的上下文对不对?有没有混淆多个聊天对象?有没有把旧信息当成新信息?有没有读取超出授权范围的内容?有没有在上下文不足时胡编?上下文测试,会成为 AI 产品测试里的核心能力。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中