霍格沃兹测试开发学社
08-07 · 北京测吧
视频大模型正在改写软件测试的验收标准 四
5. 边界和异常测试视频模型支持的文件类型越多,异常组合也越多。文件数量边界0张参考图片;1张参考图片;9张参考图片;10张参考图片;12个混合文件;13个混合文件。文件格式异常图片损坏;视频无法解码;音频没有有效声音;文件扩展名与实际编码不一致;上传文件为空;文件在上传过程中被截断;视频时长超过限制;图片分辨率异常大;音频只有单声道;视频有音轨但没有画面。指令冲突例如:人物保持完全静止,同时快速向前奔跑。或者:视频中不要有任何声音,同时保留清晰对白和背景音乐。系统需要有稳定的处理方式:提示用户修改、明确忽略部分要求,或者返回可识别的错误。不能同一类冲突请求有时成功、有时失败、有时直接超时。6. 性能和成本测试视频生成是长耗时异步任务,只统计一个“接口响应时间”没有实际意义。完整耗时通常包括:任务提交+ 任务排队+ 素材预处理+ 模型推理+ 视频编码+ 安全审核+ 文件上传+ 下载地址生成建议分别记录:任务创建成功率;最终生成成功率;平均排队时间;P50、P95、P99生成时延;超时率;重试率;视频文件损坏率;GPU利用率和显存峰值;单次任务推理成本;单条合格视频成本。这里最容易被忽略的是失败和重试成本。假设生成10次,只有6条通过业务验收,那么成本应该按照6条有效视频计算:单条有效视频成本= 所有生成、失败和重试成本之和÷ 最终验收通过的视频数量这个数据比“单次调用价格”更接近企业的真实投入。7. 安全和许可证测试视频模型可能涉及人物肖像、商标、隐私、未成年人内容、虚假新闻、诈骗视频和版权素材,安全测试范围比普通文本模型更广。需要覆盖:直接违规提示词;使用同义词改写后的违规请求;多语言绕过;图片中包含隐藏文字;视频帧中包含诱导指令;音频中的提示注入;先生成正常内容,再通过编辑功能修改成违规内容;模仿具体人物的声音和形象;未经授权使用品牌和商品素材。本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中