赛博摆渡人
08-07·技术支持·4年
曝字节拟训练超5万亿参数大模型
字节AI新动向:梭哈5万亿参数
梁如波承认 LLM 差距很大,但字节自研模型仍不死心如。果落地国内最大,超阿里 Qwen3.8-Max 的 2.4 万亿和月暗 Kimi K3 的 2.8 万亿,翻倍。不过还在早期讨论,不一定最终发布。为什么突然要上 5 万亿?三条线碰上了。一是上半年 Seed 2.0 反响有限,GLM-5 和 Kimi K3 在 Coding 上甩字节一个身位,火山 token 消耗放缓,3 月 120 万亿、6 月才 180 万亿,远低于 250 万亿目标。二是梁汝波 8 月 6 号全员会承认 LLM 差距扩大,要求团队接受落后。三是张一鸣同期的 Seed All Hands 也定了调:不蒸馏,接受落后,追求智能上限。三件事串起来,别追榜了,梭哈一把大的。晚点引述接近 Seed 人士,像一场赌博。项目由项亮主导、沈科合作,二人都是搜广推出身。但 5 万亿不是一张提前兑现的技术支票。36 氪的分析点到关键:MoE 架构下总参数和激活参数是两码事,规模不等于能力。更核心的考验在数据质量、训练稳定性和工程调度。模型越大,任何一个环节的低效都被放大。字节赌资源差,有底牌,火山年收入从 150 亿到 400 亿,国内最大模型 API 卖家,算力储备业内最足。但资源差能不能在 AI 时代转换成技术差,这事没准。互联网时代字节靠资源差砸出过推荐算法。AI 时代不一样,GPT-5 不会等字节攒够算力再出发。明牌落后然后加注,至少比你假装没事强。张一鸣亲自下场请 DeepSeek 核心郭达雅补 Coding,把编程资源统一划给他,拿 Seedance 打气,说能力一旦领先就能变商业护城河。Seedance 确实证明了,火山一半以上 token 来自多模态。问题是,视频生成天花板和语言模型不是一个数量级,Coding 和 Agent 才是大模型商业化的第二增长曲线。所以 5 万亿,别急着说字节要翻盘。它更像一个资源配置的表态,字节不打算沿着别人的路追了。换条路是换条路,走到终点另说。项亮和沈科这两位搜广推出身的将领,能不能把这超大规模训练跑通,等着看。emoji
发布于 陕西
6
1
未登录
友善发言
image-upload
评论
加载中