散峰而望
08-10·算法工程师·1年
开源模型这么多,为什么选Kimi K3?
长程、高难任务,主动性让我选择了 K3
为什么选择 K3,首先从参数上来看 2.8T 参数模型,是目前全球范围内,参数规模最大的开源模型,全球范围内,能把模型预训练做到这个万亿量级的 AI 公司,一只手数得过来。同时 K3 支持 1M 上下文,用了新的 Kimi Linear 混合线性注意力架构,该混合架构在一些层里使用更高效的 KDA,在另一些层里保留 MLA,让模型仍然可以直接查找上下文里的具体信息,使得能降低处理超长内容的成本,也可能保住模型对细节的理解能力。在注意力残差中使用 AttRes 将深层的信息访问变成按需检索的网,使其能精准调用。KDA 和 AttRes 结合让 K3 能够一个处理上下文长度,一个处理模型深度,这也是 Kimi 官方所说的,让信息在更长的序列和更深的模型里流动得更顺畅。宽度方向 K3 也处理的很好,K3 路由专家扩到 896 个,每个 token 只激活 16 个,用了叫 Quantile Balancing 的办法,直接从路由分数的分位数来推导专家分配,砍掉了传统方法里又敏感又难调的平衡超参数。配合归一化和一个新的激活函数 SiTU-GLU,把稀疏的模型在训练时摁稳。在 K3 的后训练中,K3 的 RL 铺得很广,横跨三大领域,通用任务、通用智能体、编程智能体。每个领域再配三档思考强度,低、高、最高。三乘三,一共练出 9 个专家模型,并用一套叫多教师在线策略蒸馏的方法,把这九个专家的本事,统统压进一个统一的模型里。在最大化 token 效率的同时精细调节推理强度。我个人使用上,觉得K3 比 GLM 5.2 要聪明,在长程任务方面的推理深度更好,它和 Opus 4.8 比较接近,而且自主推进项目的意识特别强。在交互、界面、视觉、空间等相关场景完全可以作为首选模型,但架构、后端等场景,仍落后于最强闭源模型 Claude Fable 5 和 GPT-5.6。整体来说 K3 模型优化了长程、高难任务,并且主动性很强,绝对是工作中的利器。不过遇到简单、模糊需求,反而会过度思考和发挥。
发布于 河南
分享
评论
2
未登录
友善发言
image-upload
评论
加载中