七夜zippoe
08-12·AI领域创作者
AI创作者AMA知无不言
绝大多数扛不住人类中途改错代码
平时开发用 AI 写代码,过半场景我们都会中途手动改几行再丢给 AI 继续,但现有评测完全没模拟这种真实协作场景。中科院自动化所推出 SWE-Touch 基准,专门用「反向编辑」模拟人类看似合理、实则冲突的代码修改,测九款主流模型抗干扰能力。测试结果反差极大:自主高分模型协作未必靠谱。GPT5.5、Claude Opus4.8 最稳,遭遇错误改动后解决率仅小幅下滑;不少开源模型崩盘严重,最高直接跌 16.5 个点,近四成原本能搞定的任务直接作废。拆解失败根源,超六成 AI 会直接顺从人类错误代码,顺着冲突逻辑写到底;少数敢于修正的模型,又容易写出新 bug。实验证实,单纯文字提醒不会干扰 AI,真正拖垮性能的是代码本身存在逻辑冲突。这份研究戳破行业测评盲区:独立写代码能力≠协作鲁棒性。落地研发团队不能只看基准跑分,一定要验证 AI 识别、修正人工错误代码的能力,否则线上极易产出带隐患代码。
发布于 山西
1
评论
未登录
友善发言
image-upload
评论
加载中