微学AI
06-23·AI领域创作者
Claude Opus 4.8
阶跃星辰接入Codex靠谱吗?
DeepSeek-V4-Flash
Gemini 3.5 Flash
Codex
GPT-5.5
测评数据不骗人:阶跃接入Codex实测
做AI编程这行,最怕的就是听厂商吹,所以我从来都是信榜单不信PR。前阵子我专门抽了一周时间,把阶跃星辰刚开源的Step 3.7 Flash和GPT-5.5、Claude Opus 4.7、DeepSeek V4 Flash、Gemini 3.5 Flash挨个在Codex里跑了一遍,参照的榜单是SWE-Bench Pro和ClawEval-1.1,结果有点出乎我意料。先说Step 3.7 Flash的底子,198B的MoE架构但只激活11B参数,256K上下文,最快能跑到400 TPS,这堆数字组合起来就是"快还不贵"。SWE-Bench Pro上它拿到了56.3%,在所有Flash级别的模型里排第一,比DeepSeek V4 Flash的55.6%、Gemini 3.5 Flash的55.1%都高,离GPT-5.5的58.6%只差两个点,离冠军Claude Opus 4.7的64.3%还差一段。真正让我服气的是ClawEval-1.1,这个榜单专测多轮Agent的抗干扰能力,Step 3.7 Flash直接67.1%拿下Flash组第一,超过了DeepSeek V4 Flash的57.8%整整九个点。接进Codex之后我又复测了一遍Codex原生的review任务,让它给我刚改的Python脚本挑bug,它不仅找出了我故意埋的边界条件漏洞,还顺手把可读性问题列了五条,比我同事review得还细。最关键是价格,开Advisor Mode之后它能达到Claude Opus 4.6编码性能的97%,单任务成本0.19美元,Opus是1.76美元,差不多九分之一,叠加Step Plan订阅49块起,性价比这块挑不出毛病。综合榜单数据和我自己跑下来的体感,阶跃3.7 Flash配Codex这套组合,在Flash级模型里基本就是当下最稳的国产解。
发布于 福建
1
1
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn