Ai达芬奇
08-07·AI领域创作者
Agent 连续工作几个小时,真正难的是中途失败后,还能准确知道自己做到哪了。阿里高德团队开源的 LongHorizon-Harness,专门解决长时任务中的状态漂移和错误累积。它把执行过程拆成 Manage–Execute–Audit 循环:Manager 根据已经验证的进度安排下一步;Executor 在全新上下文中操作桌面、浏览器或命令行;Auditor 再独立检查真实环境。只有审计确认的结果,才会进入长期任务状态。遇到操作失败、上下文刷新或交付不完整时,Agent 可以保留已完成的部分,从缺口继续推进。它也不绑定具体模型和后端,可以接入 Claude、GPT、Qwen,以及 Claude Code、Codex CLI、OpenClaw 等工具。在相同的 Qwen 3.7-Plus 与 Claude Code 配置下,GUI 与 CLI 混合任务通过率从 51.8% 提升到 80.7%;OSWorld 完整完成率从 2.8% 提升到 8.3%;Terminal-Bench 成功率从 69.7% 提升到 77.2%,同时减少了 24% 的 token。这篇最有意思的地方在于,它把长时能力的重点,从让一个会话持续运行,推进到了让每段进度都可验证、可恢复,也能可靠地交给下一轮。模型决定单步能力,harness 决定这些步骤最后能不能拼成一个完整交付。https://taou.cn/a/iglhWx
发布于 美国
分享
评论
1
未登录
友善发言
image-upload
评论
加载中