暗物志
06-22·AI领域创作者
Kimi-K2.6
Kimi K2.6 vs GLM-5.1,推理对决
Kimi
GLM-5.1
4年DevOps,Kimi GLM谁坑
Kimi K2.6半年换回GLM-5.1,别信跑分。本地谁坑,账单说了算。去年接内部知识库要完全离线。两张A10,老板催。从vllm到sglang都试了一遍。第一关是显存。Kimi K2.6官方推荐双A100 80G,本地塞不下。4bit量化,70B塞48G显存剩5G,18 tokens/s。GLM-5.1同4bit,60B压40G,22 tokens/s。第二关是工具调用。Kimi改完vllm 0.4.2后function call卡死,log里timeout。GLM的tool_use稳定在0.3秒内,连跑200次没断。第三关是日志。Kimi跑长上下文偶发OOM重启,3小时任务平均崩2次。GLM跑了72小时显存波动1G内。最坑是生态。Kimi的gguf版本更新慢社区分裂,Ollama和LM Studio各跑各的。GLM官方vllm和TGI双镜像,docker-compose起。账单也证明选择:3个月迁移期,Kimi多花6000块电费,GLM多花2000块工程师时间。老板看到账单:别折腾。#DevOps #AI部署 #Kimi #GLM5.1 #大模型本地化
发布于 内蒙古
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn