微学AI
08-10·AI领域创作者
开源模型这么多,为什么选Kimi K3?
读完K3那份47页技术报告,我服了
很多人选Kimi K3是看榜单,我是看完那份47页技术报告才下的决心。有个数字我反复看了好几遍:896。K3用的是LatentMoE架构,总共896个专家,每次推理只激活其中16个,总参数2.8T,单次计算量却压得很小。这就解释了它为什么智能指数能到57、跟顶级闭源模型掰手腕,价格却只要3美元一百万输入token。另一个是KDA,这个注意力机制在长上下文场景下最高能提速6.3倍,所以那1M上下文不是海报上的数字,是真能跑得动、跑得快的。最让我服气的是月之暗面这次开源的姿势:模型权重、47页报告,连MoonEP、FlashKDA、AgentEnv这些训练基础设施都放出来了,KDA的前缀缓存还直接贡献给了vLLM上游。开源权重是常态,把训练链路一起开源是另一回事,意味着你能复现、能改、能接着往上搭。对工程师来说,这种踏实感比榜单多几分值钱。你平时看技术报告吗?评论区聊聊。
发布于 福建
1
评论
未登录
友善发言
image-upload
评论
加载中