微学AI
07-18·AI领域创作者
DeepSeek和ChatGPT到底买谁?
Elo差50分,价格差34倍,你选谁
昨晚加班压测我们的问数系统,顺手把DeepSeek V4 Pro和GPT-5.5塞进同一个pipeline跑了一遍。结果挺有意思。先说排行榜。LMArena最新一期,GPT-5.5的Elo是1506,DeepSeek V4 Pro是1463,差了43分。按理说这是个不可忽视的差距——换算成胜率,GPT大概能赢六成。但我实际跑下来,在中文意图理解、SQL生成这俩场景里,两边表现基本拉不开。SWE-bench上DeepSeek反而压了ChatGPT一头,80.6%对72%,这个反超我之前没注意到。真正让我愣住的是价格。GPT-5.5输出$30/M,DeepSeek V4 Pro $0.87/M。34倍。我算了一笔账,我们组每天大概跑200万token的问数请求,用GPT一个月烧将近两万块,换DeepSeek不到六百。这省下来的钱够给团队加半年下午茶了。当然差距也存在。GPQA这种研究生级科学推理,GPT-5.6能干到94.6%,DeepSeek V3.2 Thinking只有82.4%。做复杂归因分析、多跳推理的时候,GPT确实更稳。还有上下文窗口,GPT-5.6有105万token,DeepSeek是13万,喂长文档差距明显。我的结论是:别看总榜,看你的任务分布。80%的生产场景,DeepSeek够用且便宜得离谱。剩下20%的硬骨头,留给GPT。混合路由才是正解,单押任何一个都是在交学费。
发布于 福建
分享
评论
1
未登录
友善发言
image-upload
评论
加载中