渣渣盟
1天前·AI领域创作者
Fable 5发布,写代码实测有多强?
实测Claude Fable 5
8月中旬,Anthropic正式发布了*Claude Fable 5*——第一个面向公众开放的“神话级”(Mythos-class)模型。硬指标有多恐怖?SWE-bench Pro(Agent编程能力)拿下了80.3%,Opus 4.8是69.2%,GPT-5.5只有58.6%。但真正让我在意的是*FrontierCode*——这个基准不测“代码能不能跑通”,而是测“代码能不能被真实开源项目接受、合并进主干”。任务从Celery、Mattermost这些项目里挑,每一道题专业开发者要打磨四十多个小时。最难的Diamond题,Opus 4.8只能做对13.4%,GPT-5.5是5.7%。*Fable 5多少?29.3%,差不多是第二名的两倍。Anthropic放了个Stripe的案例:在一个5000万行的Ruby代码库里,Fable 5用一天时间完成了整个库的迁移,而这件事原本要一整个团队干两个多月。但有一个关键细节官方不会主动告诉你这次Anthropic同时放出了Fable 5和Mythos 5,它俩其实是同一个底层模型。区别只在安全护栏的松紧程度上。Fable 5加了一层安全分类器,遇到涉及网络安全、生物化学或模型蒸馏的请求时,会降级到Opus 4.8处理。Mythos 5是把护栏拆掉的“完全体”,只发给审核过的机构,普通人接触不到。官方说平均不到5%的会话会触发降级——但你永远不知道自己的请求会不会刚好踩中那5%。价格也是全球最贵每百万输入Token 10美元,输出50美元。对比一下:DeepSeek V4约1.2美元,Opus 4.8约55美元,GPT-5.5约65美元。*Fable 5的总成本是DeepSeek V4的50倍。我的判断Fable 5在编程和Agent能力上确实是目前最强,没有之一。但“最强”的背后藏着三个现实:①5%的请求可能被降级到Opus 4.8;②价格贵到普通开发者用不起;③真正的完全体Mythos 5普通人接触不到。对于不差钱、追求代码质量上限的团队,Fable 5是天花板。对于预算敏感的开发者,性价比路线依然是DeepSeek和国产模型的主场。互动问题:你会为了Fable 5的编程能力接受它的价格吗?
发布于 天津
分享
2
未登录
友善发言
image-upload
评论
加载中