格子灰
08-07·后端开发·10年+
测试提前发现风险,为什么绩效常常不如开发
测试的产出是隐形的,AI时代更是有个事儿一直让做测试的朋友挺憋屈的。开发的产出可以数,多少个需求、多少行代码、多少个接口。测试的产出呢,拦住了多少个本来会上生产的bug,减少了多少返工,这些算哪里?以前就不好算,现在更难了。AI把开发从“数周”压到“数小时”,显性产出被放大了;测试嵌进CI实时跑,短期看不见“测了多少”;坚守传统节点,又被说拖交付。METR做过统计,约一半通过SWE-bench Verified的AI代码方案,真实项目维护者会拒绝。OpenAI自己也在2026年2月弃用了SWE-bench Verified,因为发现59.4%的最难任务测试用例本身有缺陷。测试过了不等于是对的,这个道理大家都懂,但度量体系没变,绩效评定还是看显性产出,测试岗的处境就一直是这样。
发布于 湖南
分享
评论
未登录
友善发言
image-upload
评论
加载中