花花啦
06-25·护士·1年以下
国产大模型推理能力实测对比
Kimi-K2.6
智谱清言
DeepSeek-V4
Kimi
MiniMax M3
让AI做高考数学,最高148分,最低137分,差在哪?上个月新京报搞了个有意思的测试——让6款大模型做2026年新高考I卷数学。请了两位特级教师按高考阅卷标准打分。分数出来了:· 🥇 讯飞星火:148分· Kimi:145分· DeepSeek:144分· 智谱:143分· MiniMax:142分· ChatGPT:137分基础题大家差不多,选择题填空题几乎全员满分。真正拉开差距的是解答题和压轴题——能写出严谨推导过程的分数就高,逻辑跳步的就被扣分。压轴题(第18、19题)成了分水岭,有模型最后一题只得了12分(满分17分)。老师点评很到位:现在大模型的数学能力竞争,已经不是“能不能算出结果”,而是“过程够不够严谨、逻辑完不完整”。那之后我看AI的心态变了一点。跑分再高,解不出压轴题也是虚的。你们平时用哪个AI?
发布于 江西
分享
评论
未登录
友善发言
image-upload
评论
加载中