logo
登录 / 注册

面试官问:Agent 怎么评测?(一)

头像
霍格沃兹测试开发学社
06-06 · 测试开发工程师
关注 霍格沃兹软件测试开发 公众号,回复「资料」, 领取人工智能测试开发技术合集 如果面试官问你: “Agent 怎么评测?” 很多人的第一反应是: “看准确率。” 这个回答不能说完全错,但在 Agent 面试里,确实有点浅。 因为 Agent 不是普通的大模型问答。 普通问答更像是: 用户提问 → 模型回答 → 判断答案对不对。 但 Agent 更像是一个会连续执行任务的系统。 它可能要理解用户意图、拆解任务、选择工具、调用接口、处理异常、继续推理、生成结果,甚至还要根据用户反馈继续调整。 所以,评测 Agent 不能只看最后一句话答得对不对。 真正有工程落地意识的回答应该是: Agent 评测不是单一准确率评测,而是一套围绕任务结果、执行过程、工具调用、成本、稳定性、安全性和用户反馈建立起来的持续评估体系。 这篇文章,我们就把这道面试题讲透。 目录 为什么 Agent 不能只看准确率 面试标准答案应该怎么说 Agent 评测首先要看清执行过程 Agent 到底应该评测哪些指标 离线评测:上线前先拦住明显问题 在线评测:上线后才是真实考场 失败样本回流:让 Agent 越测越稳 面试时可以直接复用的完整回答 一、为什么 Agent 不能只看准确率 以前我们评测一个模型,经常会准备一批问题和标准答案。 比如: 用户问:“Redis 为什么快?” 模型回答里提到了内存存储、单线程模型、I/O 多路复用、数据结构优化,那大概率就算回答不错。 但 Agent 不一样。 Agent 不是只生成一个答案,它往往要完成一个任务。 比如用户让代码 Agent 修复一个 Bug,它可能要经历下面这些步骤: 这时候,只看最终答案是不够的。 因为 Agent 可能出现很多“结果看起来还行,但过程很糟糕”的情况。 比如: 一个 Agent 最后答对了,但中间调用了 8 次大模型,成本特别高,它算好吗? 一个 Agent 最后生成了正确结果,但用户等了 3 分钟,它算好吗? 一个 Agent 最后给出了答案,但没有调用应该调用的工具,而是自己编出来的,它算好吗? 一个 Agent 在测试环境跑得很好,但上线后因为外部工具经常超时导致失败,它算好吗? 一个 Agent 最后任务完成了,但执行过程中访问了不该访问的数据,它算好吗?
面试官问:Agent 怎么评测?(一)脉脉
阅读 1
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    头像
    我来说几句...