方小瑜
08-06·测试·5年+
DeepSeekV4 Flash实测分享
DeepSeek V4 Flash实测
最近开发者社区被它刷屏了 我花了几天接进实际工作流 说几个真实感受先说价格 确实便宜到离谱缓存命中输入2分钱每百万Token 未命中输入1块钱 输出2块钱 美国研究机构做了独立评测 V4 Flash每项智能指数任务的加权平均成本3美分 不到Claude Fable 5的百分之一实测修复一个生产环境Bug 从定位到给方案全程不到3分钟 消耗不到21.7万Token 缓存命中率接近全量 总成本不到1块钱 这个价格意味着你可以拿它当不限量实习生用 试错成本几乎可以忽略但真正让我换不掉它的 是快同任务同提示词 V4 Flash加Hermes大概40秒完成 GPT 5.6 Sol加Codex用了1分47秒 有开发者买了Codex Max 20 Pro 用了一周后主力换成了V4 Flash 原因是响应几乎即时 长对话不拖沓 100万上下文扛着项目代码也流畅模型能力95分和92分的差别一天可能感觉不到 但响应快3倍和慢3倍 十分钟就能感知到能力方面 Agent是最大亮点V4 Flash正式版总参数2840亿 激活参数130亿 MoE架构 支持100万Token上下文 最让人意外的是它的实现路径 模型结构和预览版完全一致 只重新做了后训练 没有加参数没有换架构 就把Agent能力拉到了超过自家Pro预览版的程度基准测试数据 智能体测试得分25.2 接近Opus 4.8的25.7 远高于预览版15.8 全栈开发测试达到68.7 第三方评测综合智能指数得分50 国内落后于Kimi K3的57和GLM 5.2的51但也有明显的短板不支持多模态图像输入 2840亿总参数130亿激活的体量 在复杂长流程任务规划中会感到吃力 有企业技术人员反馈 在Agent长流程任务里基本没法用 但在非Agent任务里价格是真的便宜 小错误在几百轮操作中容易逐步累积 最终影响整体结果适合什么场景单点定位单次修复是它的绝对主场 整库检索财报分析卷宗处理这类允许低成本重来的任务场景非常适合 代码调试批量文档处理高频对话场景性价比极高不适合需要连续规划几百步 调用工具并自主执行的复杂Agent任务 复杂架构设计场景跟顶级闭源模型仍有明显差距
发布于 四川
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn