微学AI
07-18·AI领域创作者
Kimi-K3
DeepSeek和ChatGPT到底买谁?
双持三个月,我搞懂了怎么分活儿
折腾了三个月,我现在问数系统的配置是:DeepSeek V4 Flash管日常,GPT-5.5管硬骨头,中间用Qwen3.7-Plus兜底。三模型路由,成本降了七成,质量没掉。一开始我也纠结过选谁。看了aitooltier的评测,ChatGPT综合8.8分,DeepSeek 8.0分,好像差距不小。但拆开看,输出质量两边打平都是8.0,DeepSeek在性价比上9.5碾压ChatGPT的8.0,ChatGPT在易用性和功能丰富度上反超。这说明什么?说明没有全能选手,只有合不合适。我定的路由规则大概是这样。用户问"上个月营收多少"这种简单查询,走DeepSeek Flash,$0.14/$0.28,响应快,五十多token的答案,成本几乎为零。问"为什么华东区Q2环比下降"这种需要多表关联和归因的,走GPT-5.5,它的GPQA 92.8%不是白给的,复杂推理确实稳。中间地带,比如生成周报、解释图表,丢给Qwen3.7-Plus,$0.43/M,中文表达流畅,性价比高。有个意外发现。LMArena上GPT-5.5和GLM 5.1、GPT-5.2 Chat的Elo都是1475,完全打平。这说明头部模型之间的差距已经在噪声范围内了,排名上前后的几十个Elo,真没那么重要。重要的还是你自己的eval set。我建了个200条的业务测试集,每次模型更新都跑一遍,这才是选型的硬标准。最后说句实在的,这两个都不是终点。Qwen3.7-Max、Kimi K3、GLM-5.2都在后面追,半年后的格局可能又变了。与其纠结买谁,不如把路由层做厚,模型当插件用,谁强换谁。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中