雪咤
07-09·全栈工程师·5年+
K神:先做透模型,再催Agent干活
一句话让全场Agent开发者安静了
K神(Andrej Karpathy)最近在AI开发者大会上一句话让全场安静:"别再逼你的Agent什么都干,先把底层模型做对。他5月刚加入Anthropic做预训练,说Agent热潮正在重蹈OpenAI五年前的弯路——Demo容易,产品要十年,Agent不是产品,基础模型才是核心,基础扎实了Agent自然会长出来。OpenAI自己的GeneBench-Pro显示GPT-5.6在真实科研工作流端到端通过率才28.7%。做企业级Agent做了整整两年,看到K神说"先把模型做透,再催Agent干活",我举双手双脚赞成,这就是我们在一线踩了无数坑之后最深的感受。前两年整个行业都在卷Agent框架、卷Prompt工程、卷多Agent协作,好像只要框架写得好,Prompt调得妙,什么任务都能搞定,结果呢?Demo一个比一个炫,一到生产环境就拉胯,意图理解错、工具调用错、上下文丢失、长任务中途崩,各种低级错误层出不穷,你打多少补丁都没用,因为根上的问题是模型能力不够。我给大家说个真实数据,我们自己测过,同一个Agent系统,用GPT-4o做底座的时候,任务成功率大概40%,我们花了三个月调Prompt加各种补丁优化,提到了55%,感觉已经到极限了;后来换成GPT-5.5,同样的代码几乎没改,成功率直接干到75%,再后来换了最新的Claude 3.7 Opus,直接85%+。你说这三个月我们在干嘛?在给模型能力不足擦屁股。如果底座模型连基本的推理、规划、长上下文理解都做不好,你Agent框架写得再花哨有什么用?就像你发动机不行,光给车装各种空气动力学套件尾翼,它也跑不快啊。K神说"基础扎实了Agent自然长出来",真的是至理名言。前阵子有个团队跟我们吹牛说他们多牛多牛,结果一打听他们连7B模型微调都没做过,全靠调API写Prompt,我就知道做不出什么能用的东西。当然不是说Agent框架不重要,而是顺序不能搞反了,模型是1,框架和工程是后面的0,没有1再多0也没用。你们在一线做Agent也有这种感觉吗?是不是也觉得很多问题根源是模型不行?
发布于 广东
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn