logo
登录 / 注册

面试官问:Agent 怎么评测?(三)

头像
霍格沃兹测试开发学社
06-06 · 测试开发工程师
四、Agent 到底应该评测哪些指标Agent 的评测指标不要只说准确率,建议从八个维度展开。1. 任务完成率任务完成率关注的是:用户交给 Agent 的任务,到底有没有完成。比如:代码 Agent 有没有成功修复 Bug。 数据分析 Agent 有没有生成可用报表。 客服 Agent 有没有解决用户问题。 测试 Agent 有没有生成可执行的测试用例。 自动化 Agent 有没有真正完成脚本生成和执行验证。这个指标比单纯看“回答是否正确”更贴近业务。因为很多 Agent 的目标不是聊天,而是帮用户完成任务。2. 结果质量结果质量看的是最终输出。包括:是否准确。 是否完整。 是否有用。 是否符合用户意图。 是否存在幻觉。 是否引用了错误信息。 是否缺少关键步骤。对于问答类、报告类、代码解释类 Agent,结果质量仍然非常重要。但要注意,它只是评测的一部分,不是全部。3. 工具调用质量Agent 最大的特点之一,就是会调用工具。所以工具调用必须单独评测。比如:该调用搜索工具时,有没有调用? 该调用数据库时,有没有调用? 工具选得是否正确? 参数传得是否正确? 工具返回失败后有没有重试? 重试失败后有没有降级方案? 工具结果有没有被正确利用?很多 Agent 的错误,不是语言表达能力不行,而是工具调用链路出了问题。比如用户问:“帮我查一下最近 7 天的订单退款率。”正确流程应该是调用数据查询工具。但 Agent 如果直接生成一段看似合理的分析,就是严重问题。这不是“回答不够好”,而是不该编的时候编了。4. 执行过程质量Agent 不是步骤越多越聪明。很多时候,步骤越多,越说明规划能力差。比如:一个问题明明一次工具调用就能完成,Agent 却调用了 5 次工具。一个代码修改明明只需要改一个文件,Agent 却扫描了整个仓库。一个检索问题明明应该先查资料,Agent 却先生成了一大段猜测。这些都属于执行过程质量问题。所以评测 Agent 时,要关注:有没有无意义的重复调用。 有没有多余的中间步骤。 有没有循环推理。 有没有错误跳过关键步骤。 失败后有没有正确重试。 重试失败后有没有降级。
面试官问:Agent 怎么评测?(三)脉脉
阅读 2
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    头像
    我来说几句...