微学AI
08-18·AI领域创作者
AI 编程榜:AI 编程实战任务
闭源96%很香,但我选了能私有部署的
SWE-bench Multilingual 这榜我最近翻得最多,它测九种语言、三百个真实 issue。Claude Mythos 5 拿 92.2% 排第一,确实猛,可它是闭源,我们这种带客户数据的内部系统根本不敢把代码往外发。往下看,阿里 Qwen3-Coder-Next 是榜上最强的开源,SWE-bench Verified 70.6%,腾讯 Hy3 在多语言榜也有 75.8%。我跟团队纠结了快一周到底用哪个。BenchLM 给的七月编程分里,Claude 系包揽前五,Kimi K3 77.4 排第五,但那都是按闭源 API 算的,我们一算账就皱眉:每百万 token 几块到几十块不等,一天几百次调用,月底账单能买半台服务器。最后我们定了混合打法,简单重构和单测用本地跑的开源模型,重推理、跨文件的大活才走闭源 API。这个选择老实说有点妥协,毕竟开源在难任务上确实会掉档,可数据不出机房这条红线,比那十几个点的分数更让我睡得着。排名是别人的战场,选型是自己的账本。你们团队卡在闭源能力和数据合规之间时,怎么取舍的?大家评论区聊聊。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中