雪咤
07-09·全栈工程师·5年+
K神:先做透模型,再催Agent干活
28.7%通过率一点不意外
看到OpenAI自己的GeneBench-Pro说GPT-5.6在129个真实科研工作流上端到端通过率才28.7%,我一点都不意外,甚至觉得这个数可能还有点乐观。我自己做过半年科研自动化Agent,太清楚真实世界的任务有多难了。什么是端到端通过率?就是你给Agent一个完整任务,它从头到尾自己做,中间不需要人干预,最后结果正确的比例。很多Demo里的任务都是精心挑选的happy path,步骤少、路径清晰、异常情况少,那当然成功率高;真实工作流是什么?你要读几十篇论文、要找数据集、要写代码、要调参数、要跑实验、要分析结果、要改方案、中间任何一步错了后面全错,而且经常有意外情况需要判断决策,这对模型的推理能力、规划能力、错误恢复能力、长时记忆能力要求极高,差一点都不行。我们之前做过一个类似的科研助手,最好的模型在我们自己的测试集上也就30%左右的端到端通过率,跟OpenAI这个数差不多。那剩下70%的失败是因为Agent框架写得不好吗?真不是,大部分失败原因都是模型自己犯低级错误:读表格读错列、代码写错一个变量名、跑实验报错了不会自己debug、分析结果得出完全相反的结论,这些问题你靠优化Agent框架能解决一部分,但解决不了根本问题,还是得模型自己变聪明。K神说Demo容易产品要十年,真的不是夸张,一个Demo可能花一周就能做出来,要做到90%以上的可靠性给用户真金白银用,没有三五年打磨根本不可能,而且前提还是模型能力得跟上。现在很多创业公司一上来就说自己做通用Agent,我听着就害怕,你连一个垂直场景都做不到90%可靠,怎么做通用?大家在公司做的Agent,真实端到端成功率大概有多少?敢说实话吗?
发布于 广东
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn