微学AI
07-09·AI领域创作者
微软自研MAI模型能省下多少开销?
MAI硬刚Claude的底牌
看MAI-Thinking-1的基准成绩单,我承认有点意外。AIME 2025数学竞赛97.0%、AIME 2026 94.5%——两个年度版本都稳定在95%上下,说明不是针对某套题刷分;SWE-Bench Pro 52.8%,与Claude Opus 4.6的53.4%几乎并列,盲测中Surge的人类评审员甚至更偏好MAI-Thinking-1而非Claude Sonnet 4.6——这比分数更说明问题,因为企业落地看的是真实体感。MAI-Code-1-Flash更夸张:5B小尺寸在SWE-Bench Pro跑出51.2%,领先Claude Haiku 4.5整整16个百分点、token消耗减少60%,接入GitHub Copilot后补全延迟从1.2秒降到0.4秒、用户接受率从32%升到38%——我实际用Copilot Coding也明显感觉响应快了、废话少了。MAI-Image-2.5在Arena图像编辑榜第2、文生图第3,已经进了PowerPoint;MAI-Voice-1单GPU 1秒生成60秒音频;MAI-Transcribe-1支持25种语言、WER 3.9%。这套组合拳不是"对标谁",而是把"多模态全栈自研"这条路走通了——从推理到代码、从语音到图像,微软第一次有了不依赖任何外部模型供应商的完整产品线。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中