微学AI
08-04·AI领域创作者
开源模型这么多,为什么选Kimi K3?
2.8万亿参数到底塞了什么
看完 Kimi K3 的技术报告,最深的感受是参数量2.8万亿听着吓人,关键看它怎么花。它其实是 MoE 架构,896个路由专家,每个 token 只激活16个,所以单次推理的算力开销其实收得住。注意力那块比较有意思,KDA 和 Gated MLA 按3:1混合,再加块级注意力残差,报告里说是为了让百万级长上下文训练不发散。视觉编码器 MoonViT-V2 也不是后接的,是从零用 next-token prediction 一起训出来的,所以它100万上下文和原生视觉能同时存在,这个路线和大多数"语言模型加个视觉补丁"的做法不一样。真正让我有好感的是它把训练基础设施也开源了,MoonEP、FlashKDA、AgentEnv 全放出来,等于菜端上来还把配方也给了。对我这种爱翻部署细节的人,这些东西比权重本身更值得翻。代价也有,参数摆在这,生成速度比轻量模型慢2到3倍,实测等长输出确实磨人。但翻完整个报告,我最大的感觉是它不再是"开源追闭源",架构上确实有自己的东西。
发布于 福建
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn