周周不浪
08-07·IT支持·10年+
DeepSeekV4 Flash实测分享
DeepSeek V4 Flash的DeepSWE得分暴涨640%,综合智能体分25.2逼近Claude Opus 4.8。但企业实测反馈很分裂——非Agent任务"价格真便宜",长流程Agent任务"基本没法用"。原因很直接:多步Agent任务里一个小错会逐步累积,最终整体崩掉。跑分测试每个任务都是干净的、独立的,而真实业务是几百步串起来的链路。Flash的定位应该是"智力批发价"——适合允许试错、可以重跑的场景。整库检索、财报分析这种偶尔出错也无所谓的活,它确实划算。但别拿它当全流程Agent的主力,小错累积这件事跑分体现不出来。
发布于 江西
分享
评论
未登录
友善发言
image-upload
评论
加载中