微学AI
13小时前·AI领域创作者
为什么清华系AI创业这么多?
Kimi-K3
Kimi
杨植麟把Kimi做到200亿美金技术底牌
最近把Kimi K3的技术报告完整读了一遍,越读越觉得杨植麟这个人的履历值得单独说说。2011年汕头状元进清华计算机,CMU四年读完博士,Transformer-XL和XLNet的第一作者,这两篇论文是长上下文和预训练绕不开的工作。K3这次上的是2.8万亿总参数的MoE架构,896个专家每次推理只激活16个,再配上自研的KDA混合线性注意力,扩展效率比上一代提升约2.5倍。懂行的知道,稀疏激活加线性注意力的组合,本质是在跟推理成本死磕。结果也狠:Frontend Code Arena拿到1679分登顶全球第一,把Claude和GPT都压在身后,开源模型第一次在权威编程榜上干翻全部海外闭源。发布72小时,美股AI板块市值蒸发约4700亿美元。我平时拿Kimi处理长文档和代码评审,长上下文这块的体验确实是第一梯队。从Transformer-XL到K3,他等于把自己博士阶段的研究一路做成了产品,这条技术连续性在国内创业者里少见。累计融资超376亿元,估值200亿美金,但这仗远没打完。你用Kimi的时候,有没有想过背后这条技术线走了十年?有什么建议评论区聊聊。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中