朱亚威
08-17 · 得物App
给 Agent 做评测,我最意外的一条结论:我以为我在测模型,其实我在测一个已经学会了配合模型的人。我的测试集里有 17 条标着「用户提供」——全是我的真实表达。其中一条是「晚饭 阿文潮汕食府 620 家庭支出」,模型干净地判对了分类。但我后来意识到:我之所以写「晚饭」两个字,恰恰是怕它不认识这家餐馆。这条用例测的根本不是 Agent 的理解力,而是我这几个月练出来的提示技巧。这不是从论文倒推的通用教程,是我给自己记账 Agent(Personal Agent 一期)做鲁棒性评测时踩出来的真实疤痕。挑三个最扎心的:1. 三种「假绿」比红色更危险:被测对象根本没运行、门用错了(改的是 Swift,gate 跑的是 Python 的 pytest)、门的形态和被测对象不匹配。共同根因是——fake 和被测代码出自同一套假设,所以 fake 永远只会确认假设,不会反驳它。2. 分母会漂,而且往好看的方向漂。 我想证明新规则有提升,初稿写「严格通过 24/32」,改善幅度却取自另一组分母。不是故意的,是写的时候顺手拿了手边那个数。按同口径重算,是 13→16。3. eval 不是一次验收,是一条回路。 Agent 的错误不可能被消灭,所以每次错误都得可诊断、可纠正、可回流成守门用例。每错一次,测试集厚一分。全文 9 节,讲测量装置、统计纪律、判官校准,以及为什么模型说"已经记录"从来不算完成:
https://taou.cn/a/i70WVK
发布于 上海
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn