满眼星河12138
08-06·快手员工
实在Agent刷新全球纪录,究竟强在哪?
实在Agent刷新全球纪录,究竟强在哪?
8月4日,杭州实在智能的“实在Agent”以90.2%的成功率登顶OSWorld全球总榜。Meta、Anthropic、OpenAI的公开最高纪录,集体被一家中国公司反超。2024年OSWorld刚推出时,人类平均成功率72%,顶级AI模型只有12%。两年时间,从12%到90%,提升超过7倍。90%是一个关键临界点。跨过这条线,智能体才从“勉强能跑”变成“稳定可用”。实在Agent在跨应用协同任务中成功率84.7%,领先第二名近10个百分点。GIMP图像处理这种“噩梦级”场景,26个任务拿下了24个,成功率92.3%。系统底层操作24个任务100%满分零失误。这些硬骨头拼的不是模型的智力,是工程系统的稳定性。OSWorld要求智能体在真实Ubuntu虚拟机中完成文件编辑、表格处理、图像修改、邮件收发等超过300项复杂任务。全程机器自动判定结果,没有任何人工干预。实在Agent提交的是“通用模型加工程架构”的方案。同一底层模型,仅因Harness设计不同,表现差距可达6%到17%。模型是发动机,Harness是方向盘和刹车。发动机再好,没有靠谱的操控系统也跑不稳。过去两年行业问的是“哪个模型参数最多”“哪个推理最强”,现在问的是“哪个智能体最能干活”。实在Agent的90.2%告诉我们:AI已经从“能聊天”进化到了“能干活”。这个变化,比参数翻倍更有意义。
发布于 中国香港
分享
评论
未登录
友善发言
image-upload
评论
加载中