那个村的李富贵
07-01·AI领域创作者
美团开源LongCat-2.0够稳吗?
结论先行:LongCat-2.0 在“训练稳定性”上交出了令人信服的答卷,但在“模型能力”上仍有提升空间。关于“够不够稳”,要分两个层面看:⚙️ 训练与系统稳定性:超出预期这是LongCat-2.0最亮眼的地方。在五万卡国产算力集群上训练万亿参数模型,团队通过HCCL异常处理、弹性扩缩卡和自动故障恢复等技术,将月均日故障率降低了70%以上。训练全程未出现不可逆的loss尖刺与回滚,实现了稳态日吞吐超过1万亿tokens。这证明国产算力集群已具备支撑前沿级模型稳定训练的能力。🧠 模型能力稳定性:接近但未超越顶尖模型本身的表现也很稳。在权威代码基准SWE-bench Pro中得分59.5,超越了Gemini 3.1 Pro、GPT-5.5和Claude Opus 4.6;在Terminal-Bench 2.1中得分70.8。其预览版此前已跻身OpenRouter全球调用量前三。不过社区反馈也指出,其能力接近Claude Opus 4.6,但落后于最新的Claude Opus 4.8。目前网上也出现了一些关于项目是否夸大的争议声音,建议保持关注。总的来说,LongCat-2.0在“系统稳定性”上证明了自己,是国产算力的一次里程碑。但在“模型能力”上,它是一位优秀的追赶者,而非绝对的领跑者。
发布于 河南
分享
评论
未登录
友善发言
image-upload
评论
加载中