柚子知AI遇
08-06·AI领域创作者
实在Agent刷新全球纪录,究竟强在哪?
实在Agent凭啥破纪录
7月27日实在Agent以90.2%登顶OSWorld,首个突破90%大关,双榜第一,刷了Meta、Anthropic、OpenAI的纪录。但内行看门道:这个成绩的核心不是模型多强,而是Harness工程化做到了极致。Agent = Model + Harness这个公式被验证了——相同模型、相同提示词,仅靠优化任务拆解、状态管理、步骤验证、失败恢复,成功率从70%提到95%以上。Pi Research的实验更极端,只改工具格式,成功率从6.7%飙到68.3%。我自己跑过实在Agent的物流调度场景,机器学习在多步骤任务编排上确实稳,工具调用从15个裁到2个反而更准。深度学习模型不是瓶颈,推理优化和Harness基础设施才是。算法层面没有魔法,工程能力拉开差距。但90.2%是基准测试成绩,真实业务场景的复杂度远超OSWorld。生产环境里的长尾case、异常恢复、跨系统状态同步,这些才是考验Harness的地方。
发布于 上海
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn