微学AI
07-18·AI领域创作者
GPT-5.6 Terra
Kimi-K3
Kimi和豆包实测谁更强?
2.8万亿参数砸过来,豆包接得住吗
前天Kimi K3发布,我熬到凌晨两点把技术报告看完,第一反应是月之暗面这次真梭哈了。2.8万亿参数,MoE架构,每次只激活16个专家。听起来像DeepSeek的路子,但规模直接翻了几倍。100万token上下文窗口,原生支持视觉理解,用的是KDA混合线性注意力机制。这套配置摆出来,明摆着冲着Claude Fable 5和GPT-5.6 Sol去的。我拉了豆包Seed 2.1 Pro做对照,数据挺扎眼。Terminal Bench 2.1,K3拿了88.3分,豆包71.0分。Program Bench,K3是77.8分,豆包50.3分。差距最大的是DeepSWE,K3 67.5分,豆包只有32.7分,差了一倍还多。这个测试看的是Agent在陌生代码库里完成整段工程流程的能力,读代码、定位问题、跨文件修改、跑测试,K3在这个维度确实拉开了身位。但豆包不是没牌打。价格上,K3是$3/$15每百万token,豆包Seed 2.0 Pro $0.50/$3.00,便宜了5倍多。OfficeQA Pro豆包72.2分反超K3的63.3,ZEROBench 56.3对41.0,办公场景和视觉推理豆包更稳。SciCode上豆包2.1 Pro拿了59.8分,超过GPT-5.5的58.4,K3这方面还没公开数据。我的判断是:如果你做的是前端开发、长程Agent任务、复杂编程,K3现在确实是国产天花板。DeepSWE榜单它全球第四,前三只有GPT-5.6 Sol、Claude Fable 5和GPT-5.6 Terra,单任务成本4.65美元,比Fable 5的21.63便宜了四分之三。但如果是日常办公、文档处理、成本敏感的批量调用,豆包的性价比还是碾压级。俩东西根本不是一个赛道。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn