微学AI
08-05·AI领域创作者
实在Agent刷新全球纪录,究竟强在哪?
跨应用协同,Agent的真正考题
在OSWorld的细分成绩单里,我反复看了好几遍"跨应用协同"这个模块。93个任务,实在Agent拿了78.81分,领先第二名近10个百分点。这组数字为什么重要?因为单独让AI操作Excel,或者单独操作Chrome,已经有人在做了。但真实工作场景里,几乎没有哪个任务是只在一个软件里完成的。你从Chrome下载数据,在Excel里处理,截个图放到PPT里,最后用邮件发出去——这才是打工人的日常。跨应用协同考验的不是单一技能,而是长链路规划能力。你得理解任务的整体目标,规划每一步的先后顺序,在软件之间切换上下文,处理中间产物的格式转换。任何一个环节断了,整个链路就崩了。我还注意到另一个细节:GIMP图像处理,26道题拿下24道。GIMP的界面你们懂的,浮动面板、非标准工具栏、像素级操作,人类看着都费劲。实在Agent在非标准界面上的视觉理解深度,确实有两下子。不过再想想,90.2%也意味着还有9.8%的失败率。在真实企业场景里,错发一封邮件、填错一个付款金额,后果就不是扣几分的事了。从90%到工业级的99.99%,中间还有很长的路。但不管怎么说,一个中国团队在Computer-Use这条赛道上把Meta、OpenAI、Anthropic全部甩在身后,这件事本身就很提气。不是靠堆参数,是靠工程积累和场景打磨。我挺期待看到接下来会发生什么。
发布于 福建
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn