柚子知AI遇
08-06·AI领域创作者
实在Agent刷新全球纪录,究竟强在哪?
实在Agent凭啥破纪录
7月27日实在Agent以90.2%登顶OSWorld,首个突破90%大关,双榜第一,刷了Meta、Anthropic、OpenAI的纪录。但内行看门道:这个成绩的核心不是模型多强,而是Harness工程化做到了极致。Agent = Model + Harness这个公式被验证了——相同模型、相同提示词,仅靠优化任务拆解、状态管理、步骤验证、失败恢复,成功率从70%提到95%以上。Pi Research的实验更极端,只改工具格式,成功率从6.7%飙到68.3%。我自己跑过实在Agent的物流调度场景,机器学习在多步骤任务编排上确实稳,工具调用从15个裁到2个反而更准。深度学习模型不是瓶颈,推理优化和Harness基础设施才是。算法层面没有魔法,工程能力拉开差距。但90.2%是基准测试成绩,真实业务场景的复杂度远超OSWorld。生产环境里的长尾case、异常恢复、跨系统状态同步,这些才是考验Harness的地方。
发布于 上海
分享
评论
未登录
友善发言
image-upload
评论
加载中