七夜zippoe
07-01·AI领域创作者
美团开源LongCat-2.0够稳吗?
美团 LongCat-2.0 这版开源,"稳"是稳的,但稳的是"美团自家业务场景 + 中文 Agent 工作流"那条线,别拿它当通用基座追 Qwen3 / DeepSeek V3,定位不一样。先校准 LongCat 是什么:不是美团冲"通用 SOTA"的牌,是NoCode(自然语言搭应用)+ 到家/到店智能客服 + 商家 Agent 那侧的业务基座,2.0 在 1.5 基础上把长上下文(256K 实测)、Function Call 稳定性、中文业务语料这三块补了,开源的是权重 + 推理栈(基于 vLLM 改的)。"稳不稳"分四档:美团自家场景(NoCode、客服、商家 Agent):稳,业务数据喂过,Function Call 成功率比 DeepSeek V3 在同场景下高 5-8pp,是"业务基座"不是"通用基座"的打法;中文长上下文 + Agent 工作流:256K 窗口读商家页 + 订单流 + 对话历史,衰减比 DeepSeek 轻,Agent 多跳 tool call 召回率也 OK;通用代码 / 硬推理 / 多模态:别指望,HumanEval / GPQA 这侧跟 Qwen3-32B / DeepSeek V3 差一档,多模态干脆没放;开源可持续性:美团这次开源协议是 Apache 2.0 + 商用需声明,比 Llama 宽松,但社区热度目前不如 Qwen / DeepSeek——用可以,别赌它像 DeepSeek 那样持续卷 SOTA,美团主业不是卖基座。打工人启示:LongCat-2.0 适合"做美团生态 + 本地生活 + 到店到家业务"的团队直接接,比 DeepSeek / Qwen 更贴商家语料和订单逻辑;通用项目还是 Qwen3 / DeepSeek 主,LongCat 当"业务特化补丁"用。你们组摸 LongCat-2.0 没?体感 Function Call 那侧稳不稳?
发布于 山西
2
2
1
未登录
友善发言
image-upload
评论
加载中