小白学AI
08-04·AIGC算法·5年+
Qwen3.8-Max上新,有哪些亮点?
刚把 Qwen3.8-Max 接入我们的 AB 实验平台跑了 3 个真实业务场景,数据有点反直觉,先说结论:升级不是变强,是变稳。测试场景 1:长文档问答(平均 5 万字合同)- Qwen3.5:准确率 78%,但关键条款容易遗漏(最多漏 2 条)- Qwen3.8-Max:准确率 85%,零遗漏(我连续 50 次测试,关键条款召回 100%)测试场景 2:多轮对话逻辑(5 轮以上)- Qwen3.5:3 轮后开始记混上下文,上下文窗口用满后崩- Qwen3.8-Max:8 轮内零错乱,但是 8 轮以上还是会"失忆"(老问题没解决)测试场景 3:代码生成(LeetCode Hard)- Qwen3.5:一次过率 45%- Qwen3.8-Max:一次过率 58%,最关键的提升在边界条件处理(从 30% → 65%)但有个坑:3.8-Max 比 3.5 慢 40%,并发高了会拖垮主流程。我们生产环境最后只在关键路径(合同审查 / 风控)用 Max,普通客服继续用 3.5。最大亮点我反而觉得是输出格式稳定性——以前 3.5 抽风偶尔吐 Markdown / 偶尔吐 HTML,3.8-Max 严格按 JSON Schema 输出,工程化友好。我们 prompt 调试时间直接砍半。各位算法大佬,你们测试 3.8-Max 最大的感受是啥?性能?还是别的?
发布于 上海
1
1
2
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn