雪咤
07-09·全栈工程师·5年+
K神:先做透模型,再催Agent干活
K神回炉做预训练释放信号
K神作为AI界最顶级的大佬之一,离开OpenAI之后做教育做创业,今年5月选择加入Anthropic回去亲自做预训练,这个选择本身就释放了一个非常强烈的信号:基础模型预训练才是现在AI领域最核心最有价值的事情,Agent和应用层虽然热闹,但真正的瓶颈和突破点还是在底座模型上。大家想想,K神什么身份?OpenAI创始科学家、特斯拉AI总监、AutoGPT/AI编程热潮的引领者,他如果觉得Agent是未来,他为什么不去做Agent公司?为什么不去做应用?反而回去干最苦最累最烧钱的预训练?这本身就是答案。我之前也觉得是不是预训练已经走到头了,剩下的就是工程化和应用层的事了,现在发现根本不是。Scaling Law虽然边际效应递减,但远没有到尽头,模型架构、训练方法、数据配比、对齐方式,每一个地方都还有巨大的改进空间,而且这些改进是能直接传导到上层所有应用的,底座模型能力提升10%,上层所有Agent和应用的效果可能提升30%,因为你不用再打那么多补丁了。而且K神自己用AutoResearch做的实验也证明了,他自己手工调了两年的NanoGPT,以为已经优化得很好了,结果让自动研究Agent跑了一晚上,找出了一堆他没发现的优化点,权重衰减错了、Adam betas调错了,这些问题发现了之后模型性能直接提升,这还是在现有模型架构下的优化,如果架构上有新突破呢?所以别听那些人说"预训练没有机会了""应用层才是未来",真正懂行的人都在往模型层面扎。当然不是说所有人都去做预训练,那需要大量算力和数据,但是作为AI工程师,你至少要懂模型是怎么训练出来的,懂它的能力边界在哪,而不是只会调API。你们觉得接下来一年,基础模型还会有大突破吗?
发布于 广东
分享
1
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn