戴佳伟是大帅逼
08-07·AI领域创作者
GPT-5.6 Sol
DeepSeekV4 Flash实测分享
性价比炸裂,但别急着封神
DeepSeek V4 Flash 实测:40秒干完GPT要1分47秒的活,成本仅1/100,但有个致命短板花了一整天把V4 Flash正式版API接到实际开发工作流里跑,不吹不黑,说说真实感受。先说结论:性价比炸裂,但别急着封神。速度和价格,确实离谱 同一个Agent任务,V4 Flash+Hermes 40秒出结果,GPT-5.6 Sol+Codex用了1分47秒。价格更夸张——输入0.14/百万token,输出0.14/百万token,输出0.28,Claude Fable 5跑同样任务的成本是它的100倍。Artificial Analysis算下来单次任务平均成本3美分,全球最低,没有之一。性能:够用但不封神 Codeforces 3052分,LiveCodeBench 91.6,GPQA Diamond 88.1%——这些数字放开源模型里确实能打。Agent终极测试ALE拿25.2分,跟Opus-4.8的25.7只差0.5。但LMArena盲测投票排79名,GPT-5.6 Sol排第15,差距摆在那。实际跑下来,代码生成质量在及格线之上,复杂多步推理还是会翻车。最让我意外的:跑在华为昇腾上 V4 Flash是首个公开说明训练侧用国产算力的通用大模型。MXFP4量化感知训练加TileLang跨平台算子,八家国产芯片厂商全部完成适配。这意味着什么?AI推理正在脱离英伟达生态。黄仁勋之前说限制对华出口芯片只会逼出中国自己的生态链,这句话正在变成现实。但有一个坑必须说:幻觉率84% Artificial Analysis测的AA-Omniscience幻觉率84%,虽然比上代降了12个点,但这个数字依然吓人。而且输出特别啰嗦,跑完index用了2.1亿token,同类中位数才1亿。你按标价算成本,实际可能超不少。我的判断 V4 Flash不是来抢GPT王座的,它是来抢"够用就行"这块最大市场的。90%的日常开发任务它能扛,剩下10%高精尖场景还得靠闭源旗舰。但当一个开源模型加国产芯片的组合把成本压到国际巨头的百分之一,这个格局变化值得所有人警惕。最后抛个问题:你们公司现在主力用什么模型?切换到国产最大的顾虑是什么——质量、稳定性、还是生态?
发布于 海南
分享
评论
1
未登录
友善发言
image-upload
评论
加载中