小白学AI
07-16·AIGC算法·5年+
DeepSeekV4变强了吗?
做金融量化分析的:V4最让我服的不是跑分,是那20次测试里"稳定答对"的确定性帖子里百万上下文、开源策略、推理增强都夸遍了。作为拿模型做金融分析的人,我最在意一个别人少提的指标——不是它能不能答对,是它"能稳定答对"的概率有多高。我拿一个需要七步逻辑推导的金融分析case,反复测了20次。V3能稳定答对大概65%,V4到了90%以上。这25个百分点的差距,对我们这行是生死线。 一个偶尔"推理链走到一半跳错结论"的模型,在金融场景根本不敢用——你不知道哪次它会给你个看似合理实则致命的结论。V4的链式思考每步有迹可循,错误率大幅下降,这才让它从"玩具"变成"能上生产的工具"。但我也得客观提醒同行:①带逻辑陷阱的思辨题它偶尔还翻车,别全信;②纯文本,不能看图表,做研报里的图得另想办法;③超长多轮对话后期仍会漏前置细节,关键约束要反复强调。我的用法:V4做初步逻辑推导和长报告梳理,关键结论人工复核,图表类另配多模态。稳定性够了,但金融这行,再高的准确率也得留人把关。同行们,你们敢把推理结论直接用吗?
发布于 上海
1
评论
1
未登录
友善发言
image-upload
评论
加载中