关注 霍格沃兹软件测试开发 公众号,回复「资料」, 领取人工智能测试开发技术合集
如果面试官问你:
“Agent 怎么评测?”
很多人的第一反应是:
“看准确率。”
这个回答不能说完全错,但在 Agent 面试里,确实有点浅。
因为 Agent 不是普通的大模型问答。
普通问答更像是:
用户提问 → 模型回答 → 判断答案对不对。
但 Agent 更像是一个会连续执行任务的系统。
它可能要理解用户意图、拆解任务、选择工具、调用接口、处理异常、继续推理、生成结果,甚至还要根据用户反馈继续调整。
所以,评测 Agent 不能只看最后一句话答得对不对。
真正有工程落地意识的回答应该是:
Agent 评测不是单一准确率评测,而是一套围绕任务结果、执行过程、工具调用、成本、稳定性、安全性和用户反馈建立起来的持续评估体系。
这篇文章,我们就把这道面试题讲透。
目录
为什么 Agent 不能只看准确率
面试标准答案应该怎么说
Agent 评测首先要看清执行过程
Agent 到底应该评测哪些指标
离线评测:上线前先拦住明显问题
在线评测:上线后才是真实考场
失败样本回流:让 Agent 越测越稳
面试时可以直接复用的完整回答
一、为什么 Agent 不能只看准确率
以前我们评测一个模型,经常会准备一批问题和标准答案。
比如:
用户问:“Redis 为什么快?”
模型回答里提到了内存存储、单线程模型、I/O 多路复用、数据结构优化,那大概率就算回答不错。
但 Agent 不一样。
Agent 不是只生成一个答案,它往往要完成一个任务。
比如用户让代码 Agent 修复一个 Bug,它可能要经历下面这些步骤:
这时候,只看最终答案是不够的。
因为 Agent 可能出现很多“结果看起来还行,但过程很糟糕”的情况。
比如:
一个 Agent 最后答对了,但中间调用了 8 次大模型,成本特别高,它算好吗?
一个 Agent 最后生成了正确结果,但用户等了 3 分钟,它算好吗?
一个 Agent 最后给出了答案,但没有调用应该调用的工具,而是自己编出来的,它算好吗?
一个 Agent 在测试环境跑得很好,但上线后因为外部工具经常超时导致失败,它算好吗?
一个 Agent 最后任务完成了,但执行过程中访问了不该访问的数据,它算好吗?
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。