暗物志
06-23·AI领域创作者
GLM-5.1
DeepSeek-V4
国产大模型推理能力实测对比
Qwen3.7
做AI工程师2年,国产模型踩5个坑
做AI工程师2年,3天硬扛国产模型横评,国产模型踩过 5个坑。吐槽清单贴在飞书,越测越想吐槽。坑1延迟。DeepSeek V4 冷启动 4.5 秒,Qwen3.7 稳 1.2 秒,GLM-5.1 在 2 秒抖。坑2上下文。DeepSeek V4 标 128k,喂到 90k 忘表格。Qwen3.7 标 32k 实测 28k 还稳。GLM-5.1 标 200k,喂到 110k 跑偏。坑3推理。同道多步数学题。DeepSeek V4 三步对两步跳结论。Qwen3.7 三步全对。GLM-5.1 三步对两步半。坑4长文档。3 篇论文拼起来问。DeepSeek V4 引用错段落。Qwen3.7 漏第三篇结论。GLM-5.1 三篇打通,追问 4 轮还记得。坑5本地化。DeepSeek V4 量化版 7B 跑延迟 800 毫秒。Qwen3.7 量化 4B 跑得起来但胡说。GLM-5.1 量化版没开源。吐槽完。线上用 Qwen3.7 跑。老板说「你这清单像产品测评不像工程师」,我回「工程师踩完坑就是产品」。
发布于 内蒙古
分享
评论
未登录
友善发言
image-upload
评论
加载中