logo
登录 / 注册

面试官问:Agent 怎么评测?(六)

头像
霍格沃兹测试开发学社
06-06 · 测试开发工程师
八、还有一个加分点:评测方法要组合使用实际工程里,Agent 评测不能只靠一种方法。常见方式包括:人工评审。 规则校验。 自动化测试。 LLM-as-Judge。 业务指标监控。 用户反馈分析。不同方法适合不同场景。比如代码 Agent,可以通过单元测试、编译结果、静态扫描来评估。比如 RAG Agent,可以通过证据召回、引用准确性、拒答能力来评估。比如客服 Agent,可以通过用户是否继续追问、问题是否解决、转人工率是否下降来评估。比如数据分析 Agent,可以通过是否调用正确数据源、SQL 是否正确、结论是否基于数据来评估。这里要注意一点:LLM-as-Judge 很有用,但不能盲信。因为让大模型评价大模型,也可能出现偏差。所以更稳妥的做法是:简单规则能判断的,用规则判断。 业务结果能验证的,用业务结果验证。 需要主观评价的,再引入 LLM-as-Judge 或人工抽检。 关键场景一定要有人审校和标注标准。面试里如果你能讲到这层,基本就能体现比较成熟的评测意识。九、面试时可以直接复用的完整回答如果面试官问:“Agent 怎么评测?”你可以这样回答:我不会只看准确率,因为 Agent 不是普通的单轮问答模型,而是一个多步骤执行系统。 它通常会经历意图理解、任务规划、工具选择、工具调用、异常处理、结果生成等多个环节,所以评测时既要看最终结果,也要看中间过程。我会先做可观测性建设,把一次完整任务记录成 trace,把每一次模型调用、工具调用、检索请求、重试和异常记录成 span。 这样才能知道 Agent 慢在哪里、错在哪里、成本高在哪里。评测指标上,我会分几个维度看第一是任务完成率,看用户交给 Agent 的任务有没有真正完成。 第二是结果质量,看最终回答是否准确、完整、有用。 第三是工具调用质量,看工具有没有选对,参数有没有传对,工具结果有没有被正确使用。 第四是执行过程质量,看有没有重复调用、无效步骤、循环推理。 第五是检索质量,如果是 RAG Agent,还要看召回是否相关、证据是否可靠、引用是否正确。 第六是系统性能和成本,包括延迟、token 消耗、模型调用次数和接口费用。 第七是稳定性,看模型调用、工具调用、外部 API 是否经常失败,失败后是否能重试或降级。 第八是安全与权限,看是否存在越权访问、敏感信息泄露和高风险操作未确认的问题扫码进群,领取资料
面试官问:Agent 怎么评测?(六)脉脉
阅读 2
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    头像
    我来说几句...