花花啦
06-25·护士·1年以下
国产大模型推理能力实测对比
Kimi-K2.6
智谱清言
DeepSeek-V4
Kimi
MiniMax M3
让AI做高考数学,最高148分,最低137分,差在哪?上个月新京报搞了个有意思的测试——让6款大模型做2026年新高考I卷数学。请了两位特级教师按高考阅卷标准打分。分数出来了:· 🥇 讯飞星火:148分· Kimi:145分· DeepSeek:144分· 智谱:143分· MiniMax:142分· ChatGPT:137分基础题大家差不多,选择题填空题几乎全员满分。真正拉开差距的是解答题和压轴题——能写出严谨推导过程的分数就高,逻辑跳步的就被扣分。压轴题(第18、19题)成了分水岭,有模型最后一题只得了12分(满分17分)。老师点评很到位:现在大模型的数学能力竞争,已经不是“能不能算出结果”,而是“过程够不够严谨、逻辑完不完整”。那之后我看AI的心态变了一点。跑分再高,解不出压轴题也是虚的。你们平时用哪个AI?
发布于 江西
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn