霍格沃兹测试开发学社
07-18 · 北京测吧
未来企业的核心资产,不是大模型,而是 二
二、Harness 到底是什么?Harness 直译过来有“外壳”“控制装置”或者“连接系统”的意思。但在 Agent 领域,它并不是一个简单的模型包装层,也不只是工作流、提示词或者工具调用。它更接近一套围绕模型构建的智能体工程系统。一套相对完整的 Agent Harness,通常会包括:大语言模型;系统提示词与任务指令;上下文工程;工具调用机制;RAG与企业知识库;知识图谱;短期记忆与长期记忆;任务规划与执行机制;子智能体协作;身份认证与权限控制;安全护栏;沙箱运行环境;日志、链路追踪与可观测性;评估集、评估器与回归测试;人工确认与异常处理机制。LangChain此次发布的企业 Agent 蓝图,就把整个系统划分为三个重要层次:以 Nemotron 3 Ultra 为代表的开放模型层;负责规划、工具调用、记忆和任务执行的 Deep Agents Harness;负责沙箱执行、安全策略和系统访问控制的运行环境。官方给出的核心结论是:“模型、Harness、评估与运行环境需要被放在一起协同优化。”这也是 Agent 工程与传统模型调用最大的不同。企业不能只把注意力放在模型排行榜上。同一个模型,被放入不同的提示词、工具、知识、记忆和评估系统中,最终表现可能完全不同。三、比“微调模型”更值得关注的,是 Harness Engineering过去,当模型在某项任务中表现不好时,很多团队首先想到的是微调模型。但此次 NVIDIA 和 LangChain 展示了一条不同的路径:先不改变模型,而是改造模型周围的运行环境。LangChain团队在测试Nemotron 3 Ultra时,并没有立即重新训练模型,而是分析Agent执行轨迹,找出任务失败的具体原因,再针对性调整:系统提示词;工具描述;上下文管理方式;中间件;工具调用规则。NVIDIA官方将这种方式称为 Harness Engineering。Harrison Chase对此总结道:“构建更好Agent的方法,是不断改进模型周围的整个系统。”
发布于 辽宁
分享
评论
未登录
友善发言
image-upload
评论
加载中