暗物志
06-22·AI领域创作者
GLM-5.1
GLM-5
开源大模型,哪个更适合本地部署?
DeepSeek-V4
Qwen3.7
做运维4年,GLM-5.1让我意外
我做运维 4 年,天天和集群打交道。今天老板让我把 DeepSeek V4、Qwen3.7、GLM-5.1 部署本地做内网推理。最先试 DeepSeek V4,权重 90G 多,A100 单卡装不下。拆 tensor parallel 跑两张卡,每秒 28 token。但显存打满 OOM,长 prompt 直接挂,限 max_seq_len 到 4096。换 Qwen3.7,权重是 safetensors,vllm 0.6.2 启动报不支持。升 0.6.5 才起来,吞吐 35 token。INT8 量化后质量下滑,只能回 FP16。GLM-5.1 让我意外。权重 75G,单卡跑得动。吞吐 32 token,长 prompt 处理稳,接口兼容 OpenAI,老代码 zero 改。最后我打了个 Excel 评分卡,从显存、吞吐、长文稳不稳、迁移成本 4 维打分。GLM-5.1 总分最高,第二天就把生产灰度切过去了。开源大模型,哪个更适合本地部署?我这 DevOps 投 GLM-5.1 一票。#AI大模型 #DevOps日常 #本地部署 #开源模型 #GLM-5.1
发布于 内蒙古
分享
评论
未登录
友善发言
image-upload
评论
加载中