logo
登录 / 注册

未来企业的核心资产,不是大模型,而是 六

头像
霍格沃兹测试开发学社
07-18 · 测试开发工程师
十、Evals将成为Agent时代的测试基础设施在这场对话中,黄仁勋和Harrison Chase都多次提到了评估系统,也就是Evals。传统软件的结果通常比较确定。输入相同的参数,程序大多会按照固定逻辑返回结果。但Agent具有明显的概率性。即使输入同一个任务,由于上下文、模型版本、工具状态和执行轨迹不同,也可能得到不同结果。企业不能只检查Agent有没有正常运行,还需要回答:输出结果是否正确; 是否完成了用户真实目标; 是否调用了正确工具; 是否覆盖关键业务场景; 是否存在事实错误; 是否违反企业规则; 是否泄露敏感数据; 是否出现越权操作; 响应速度是否可以接受; 单次任务成本是否合理; 模型升级后是否发生能力退化。LangChain官方强调,Evals应该贯穿Agent开发的完整生命周期。上线之前,需要测试提示词、Harness、工具、模型和数据变化;上线之后,则需要监控真实行为,将生产环境中的失败案例转化为新的回归测试。([LangChain][1])这意味着,Agent评估不是上线前做一次测试就结束,而是一个持续运行的质量闭环:评估—发现问题—分析轨迹—调整系统—回归测试—重新上线。从这个角度看,Agent的普及不会削弱测试与质量工程的重要性,反而会扩大测试对象的范围。未来需要测试的不只是传统软件功能,还包括:模型; Prompt; RAG知识库; Agent记忆; 工具调用; MCP服务; 多Agent协作; 执行轨迹; 权限控制; 安全护栏; 最终业务结果。测试工程师也将从验证固定逻辑,逐渐走向评估智能系统的行为与结果。十一、未来的公司,可能是一组持续进化的Agent过去,一家公司通常被描述为人员、部门、系统和业务流程的集合。在Agent时代,这个定义可能会逐渐发生变化。企业一边保留原有组织,一边将大量重复性工作、知识性工作和复杂决策辅助任务,沉淀为可以持续运行的专业Agent。这些Agent会不断接收:企业数据; 业务执行结果; 领域专家反馈; 用户真实需求; 失败案例; 评估结果。再通过Harness和Evals持续改进。最终,一家企业拥有的可能不只是一套软件系统,而是一组不断进化的专业智能体。它们理解企业知识,掌握专用工具,遵守权限边界,进入真实流程,并与员工共同完成任务。这或许就是黄仁勋所说的:“未来的公司将建立在Harness之上。”
未来企业的核心资产,不是大模型,而是 六脉脉
阅读 1
声明:本文内容由脉脉用户自发贡献,部分内容可能整编自互联网,版权归原作者所有,脉脉不拥有其著作权,亦不承担相应法律责任。如果您发现有涉嫌抄袭的内容,请发邮件至maimai@taou.com,一经查实,将立刻删除涉嫌侵权内容。
相关推荐
最新发布
大家都在看
热门人脉圈
    全部1条评论
    头像
    H先生

    本文部分内容参考了霍格沃兹测试开发学社整理的相关技术资料,主要涉及软件测试、自动化测试、测试开发及 AI 测试等内容,侧重测试实践、工具应用与工程经验整理。

    07-18
    头像
    我来说几句...