微学AI
07-18·AI领域创作者
Kimi-K3
Kimi和豆包实测谁更强?
Agent榜单国产前三,但分工不同
一次我把Kimi K3和豆包Seed 2.1 Pro的Agent测试数据拉了个表格投到大屏上,会议室安静了好几秒。先说Toolathlon,这个测试看的是多工具协同、应对失败、重试、最终输出可验证结果。K3拿了73.2分,豆包50.6分。BrowseComp,网页浏览智能体,K3 91.2分全场第一,豆包86.2分。APEX-Agents,K3 37.6分,豆包33.8分。Agent这条线,K3全面领先,而且是在和GPT-5.6、Claude Fable 5这些闭源旗舰比,不是只跟国产比。但豆包有个被忽视的强项。SaaS-Bench,测试Agent在23个真实SaaS系统里完成专业工作流,豆包Seed 2.0 Pro拿了27.1分,排全球第9。Kimi K2.6是34.1分排第6,但K3的数据还没上榜。这个测试看的是持久状态、跨应用协调、领域约束,跟Toolathlon侧重点不一样。豆包在"实际干活"这个维度并不弱。我还注意到一个细节。豆包2.1 Pro在Terminal Bench 2.1拿了71.0分,Claude Opus 4.7是71.7分,Gemini 3.1 Pro是70.7分。豆包在终端操作上已经摸到了全球第一梯队的边。K3是88.3分,直接把Opus 4.8和Fable 5的84.6分压下去了,但豆包的71分放在一年前也是不敢想的。我给团队的建议是分场景用。需要长程自主Agent、复杂编程、前端代码生成的任务,走K3,Frontend Code Arena它1679分全球第一。需要SaaS工作流、办公自动化、成本敏感的批量Agent任务,走豆包,它的Code WebDev榜单1539分排第8,终端能力够用,价格还便宜。俩模型不是替代关系,是互补。国产Agent终于不是只有一个选项了,这事儿本身比谁第一更重要。
发布于 福建
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn