十、Evals将成为Agent时代的测试基础设施在这场对话中,黄仁勋和Harrison Chase都多次提到了评估系统,也就是Evals。传统软件的结果通常比较确定。输入相同的参数,程序大多会按照固定逻辑返回结果。但Agent具有明显的概率性。即使输入同一个任务,由于上下文、模型版本、工具状态和执行轨迹不同,也可能得到不同结果。企业不能只检查Agent有没有正常运行,还需要回答:输出结果是否正确;
是否完成了用户真实目标;
是否调用了正确工具;
是否覆盖关键业务场景;
是否存在事实错误;
是否违反企业规则;
是否泄露敏感数据;
是否出现越权操作;
响应速度是否可以接受;
单次任务成本是否合理;
模型升级后是否发生能力退化。LangChain官方强调,Evals应该贯穿Agent开发的完整生命周期。上线之前,需要测试提示词、Harness、工具、模型和数据变化;上线之后,则需要监控真实行为,将生产环境中的失败案例转化为新的回归测试。([LangChain][1])这意味着,Agent评估不是上线前做一次测试就结束,而是一个持续运行的质量闭环:评估—发现问题—分析轨迹—调整系统—回归测试—重新上线。从这个角度看,Agent的普及不会削弱测试与质量工程的重要性,反而会扩大测试对象的范围。未来需要测试的不只是传统软件功能,还包括:模型;
Prompt;
RAG知识库;
Agent记忆;
工具调用;
MCP服务;
多Agent协作;
执行轨迹;
权限控制;
安全护栏;
最终业务结果。测试工程师也将从验证固定逻辑,逐渐走向评估智能系统的行为与结果。十一、未来的公司,可能是一组持续进化的Agent过去,一家公司通常被描述为人员、部门、系统和业务流程的集合。在Agent时代,这个定义可能会逐渐发生变化。企业一边保留原有组织,一边将大量重复性工作、知识性工作和复杂决策辅助任务,沉淀为可以持续运行的专业Agent。这些Agent会不断接收:企业数据;
业务执行结果;
领域专家反馈;
用户真实需求;
失败案例;
评估结果。再通过Harness和Evals持续改进。最终,一家企业拥有的可能不只是一套软件系统,而是一组不断进化的专业智能体。它们理解企业知识,掌握专用工具,遵守权限边界,进入真实流程,并与员工共同完成任务。这或许就是黄仁勋所说的:“未来的公司将建立在Harness之上。”
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。