alex
08-17 · 前花旗金融信息服务(中国)有限公司
agent现在成功率还是低了一些编程还好
编程Agent真实成功率(2026最新公开评测)1、DeepSWE(文章引用基准,真实开源仓库改代码)- 任务:113个真实跨文件软件工程Bug修改- 框架:mini‑swe‑agent- 头部旗舰模型通过率 ≥70%(Claude Opus、GPT5系列、DeepSeek V4),中等模型大约55%‑68%区间2、SWE‑bench Verified(行业标杆代码Agent)- 顶级旗舰模型(Claude Opus):80%‑88%- 次一级闭源旗舰:60%~72%- 开源最强代码模型:45%~58%注意:SWE‑bench仍然偏向中小型Bug;上万行大型项目从零开发Agent真实成功率只有35%‑50%,长链路大型工程项目依然很难全自动完成三、电商真实场景:RealReplicaBench(文章核心评测)数据集:、107个完整电商全流程仿真任务,全过才算通过、没有步骤分。任务例子:采购邮件处理、商品上架、跨平台对账、售后纠纷判定、物流调度测试框架PI环境下通过率:1. Claude Opus 5:60.75%(唯一刚过60%)2. Claude Opus4.8:52.34%3. Qwen3.8 Max / DeepSeek V4 Pro:49.53%4. 其余绝大多数主流模型:35%~48%,半数任务直接失败即使换成电商专项优化Accio Work框架,整体上限提升,最高分约66%,大部分模型依旧低于55%四、其他通用真实工作Agent公开实测成功率1、E‑Bench(腾讯,APP端操作任务:QQ音乐/王者荣耀/腾讯会议)323个多步APP操作任务头部模型整体通过率 40%‑53%;长流程任务普遍低于45%2、TheAgentCompany(仿真完整小型公司办公任务)网页、邮件、文档、数据整理全套办公流程最强Agent整体自主完成率仅30%,这个评测最贴近普通白领综合办公工作,难度极高 3、WebArena网页操作基准(网页下单、表单、后台操作)通用网页任务头部Agent大约55%‑71%;电商下单类交易任务下滑至50‑59%,填表单、校验信息最容易出错
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中