七夜zippoe
08-07·AI领域创作者
GPT-5.6 Luna
V4-Flash为何能小参数反超大模型?
不是参数赢了,是"后训练+架构"赢了
V4-Flash-0731 总参2840亿、每次只激活130亿,却在9项Agent基准上全面超过激活490亿的V4-Pro预览版 。但这是"Agent赛道"的反超,不是"全维度"的反超——知识深度、1M上下文保真这些吃参数的活儿,Pro仍有优势 。三个核心原因第一,MoE架构把"容量"和"算力"解耦了。Flash总参284B,但每次推理只激活13B,相当于"用13B的成本跑284B的知识储备" 。Pro激活49B,Flash只有它的1/4,天然在吞吐和价格上占优——Agent任务恰恰是"多轮工具调用+长上下文",便宜才能跑得动。第二,CSA+HCA混合注意力让长上下文"跑得动"。传统注意力O(n²),V4用CSA(压缩稀疏注意力,只attend数百个压缩块)+HCA(每128 token压成1个的重度压缩)交替堆叠 。效果是:1M上下文下Flash的KV缓存只有V3.2的7%,单token计算量降到1/10 。Agent多轮调用工具时上下文堆积,传统模型早爆内存,Flash还能跑。第三,同骨架重做后训练,是真正的胜负手。模型结构、参数规模完全没变,DeepSeek只做了一轮针对Agent的定向后训练 。训练样本从"单轮对话"换成"真实工具链的完整执行轨迹"——从任务规划、工具调用、失败识别、回溯重试到成功判停的全链路。结果:DeepSWE从7.3暴涨到54.4(+640%)Terminal Bench 2.1从61.8升到82.7,超越Pro预览版的72.1Artificial Analysis智能指数50分,反超Pro预览版6分,距GPT-5.6 Luna仅差1分总结:Flash"小反超"大,本质上是MoE架构解耦容量与成本 + CSA/HCA解决长上下文效率 + 定向后训练把Agent能力拉满三件事的合力。它宣告了一件事——Agent时代,"参数规模=能力"的等式被打破了。但Pro在知识、长上下文、深度推理上的优势仍在,所以正确的姿势不是"Flash取代Pro",而是"按任务路由,两者协同"。你觉得这种"小模型+精准后训练"的路线,会倒逼OpenAI、Anthropic也调整策略吗?还是说他们有更深的算力储备,不屑于走这条"效率优先"的路?
发布于 山西
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn