李东赫
06-30 · 云之家网络(重庆)有限公司
QC
真实任务跑完了,我的系统却说它没完成
讲个我自己的翻车,比讲一堆道理有用。那次我以为链路终于通了:在线任务能起、状态查得到、结果也实打实生成了一批。看着全对。可我的评测壳死活报错,说查不到任务、缺标识。第一反应是 Agent 没跑起来。排查半天才发现根本不是——任务启动那个 ID,和结果批次的 ID,压根不是一个东西。我拿任务 ID 去捞结果,当然捞了个空。于是系统给了我一个特别荒诞的结论:任务真跑完了、结果真生成了,评测层却一口咬定"没有证据"。现实里这事已经发生了,我的系统愣是接不住。就这么个破 ID,把我对"证据"两个字的理解整个掀翻了。我以前默认有结果就是有证据。错得离谱。一堆数据躺那儿,你要是没法把它跟那次任务对上、没法稳定关联、没法复核,它对评测系统来说就跟不存在一样。说白了,证据不是数据本身。证据是能被正确归因、正确关联、能复核的数据。一段查不到出处、对不上对象的数据,再真也是废的。从那以后,我判一个东西算不算"完成证据",卡得很死。Agent 自己说完成,不算——它说"我生成了文件""我提交了审批",那是它的说法;得工具真返回了文件、审批系统真返回了单据状态,才作数。一个漂亮的 pass、一个 0.93、一个 success,也不算——你得说清是哪个订单、哪个审批单、哪个文件,对得上具体对象才叫证据,否则只是个好看的标签。跑完之后靠人去圆"它应该是成了"、从日志里拼个合理结论,更不算——证据得是执行当时自己留下的,不是事后包的。最后,单点我也不太敢信,最好几头能对上:Agent 说生成了、工具日志也说了、文件点开是真的、客户端也看得见,这种才硬。反过来,太多东西长得像证据,其实不是:分数很高、状态 pass、日志里蹦出个工具名、Agent 最后也说"已完成"。可只要没有真实业务对象、没有工具返回的业务数据、没有客户端可见结果、没有打得开的产物——我现在一律不当它完成。所以后来复盘任务,我问的问题变了。不再问"它为什么失败",而是问一句:我要真信它完成了,还缺哪块证据?这一问,特别照妖。你们判一个 Agent 任务"完成",靠的是它那句回答、那个分数,还是真能对上、查得到的业务证据?#Agent评测 #AI质量 #LLM #质量工程
发布于 北京
分享
评论
未登录
友善发言
image-upload
评论
加载中