李东赫
06-29 · 云之家网络(重庆)有限公司
九十多条真实数据,被我判成一条都不算数
连着写了四篇,翻来覆去就一句:别轻易判通过,证据不够别盖章。今天讲点更里面的——我做 Quvio 的时候,真正卡住我的,不是"怎么判失败",是一个更早的问题:到底什么东西,能算"业务完成的证据"。听起来这还用问吗?任务跑完了,有输入有输出有日志,不就是证据。我一开始也这么以为。直到撞上一批真实运行数据。那批数据是真的,九十多条,每条都有输入、输出、调用 ID、批次 ID、时间戳。按大多数评测平台的思路,到这一步已经可以开打分了。但 Quvio 最后把它整批判成了"只是声明",一条都没让进。为什么?因为它缺一样东西:独立的佐证。它有"Agent 说自己输出了什么",但没有工具那边返回的业务数据,没有客户端真正可见的结果,没有产物本身的内容,没有外部状态真的变了的痕迹。说白了,这九十多条,全是 Agent 在自说自话。它说它做了,但没有任何它之外的东西能印证。那一下我才想明白:证据线不能画在"模型说它做了"这里。后来我以为我画对了,给证据校验加了一道关卡,自测全绿。结果自动 review 连着两次把我打回来,理由扎心:有个字段写着"没有产物",居然也能当佐证混过去;一个 0.93 的分数,也能被当成业务证据;一个"通过"的判定结论,也能被拿去当证据。你看,分数、判定、状态标签——这些东西长得太像证据了,有值、能比较、能入库。但它们一个都不是。它们只是系统对结果的"说法",不是结果本身。所以 Quvio 现在最核心的取舍,根本不是"怎么少误报"。它还没跑到那个阶段。它现在死磕的是更前面一步:先别让假的证据混进来。宁可告诉你"这个不可判定",也绝不把一句声明、一个分数、一个状态,包装成"它真的完成了"。这事我到现在也没完全抠干净,还在一条条往下筛。但方向我是认的:一个评测系统最该防的,不是漏判,是假装自己有证据。你们判一个任务"完成",凭的到底是它之外的佐证,还是它自己的那句"我做完了"?#Agent评测 #AI质量 #LLM #质量工程
发布于 广东
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn