学与技术
07-16·后端开发·1年以下
布林:Transformer能通向AGI
ScalingLaw翻车,万亿算力打水漂
7月4号前OpenAI大模型优化研究员Diogo Almeida发了一篇博客叫《Scaling Laws, Honestly》,直接指出2020年Kaplan那篇影响整个行业的Scaling Law原始论文存在系统性bug。翻译成人话就是:过去五年全世界AI公司照着这条曲线花钱,结果核心结论——"优先扩大模型参数量"——从源头就是偏的。这个bug导致GPT-3以及之后整整一代大模型的训练策略都走了弯路,万亿级算力投入的分配逻辑可能从根本上就是错的。DeepMind顶尖研究员转发佐证,后续多篇复盘论文接连补刀,甚至连修正它的Chinchilla定律自身也存在计算漏洞。我在一家做推理优化的公司跟朋友聊,他说他们内部已经重新调整了训练资源分配策略,不再一味堆参数,而是把更多算力放在数据质量和架构创新上。这件事对工程师的启示很直接:不要迷信"大就是好",理解架构原理比会调参重要十倍,能设计高效架构的人未来会比只会堆算力的人值钱得多。
发布于 广东
分享
评论
1
未登录
友善发言
image-upload
评论
加载中