宋宇寒
08-09 · 无
国产旗舰模型扎堆,哪款最具性价比?
或许企业应该建立能够适应不同大模型的能力
可以感觉到最近GLM5.2和Kimi K3发布之后,获得同等 AI 能力的成本其实是在下降的。这个问题其实不能只看 Token 单价。假设一个模型便宜了一半,却无法完成原来的编程任务,那不能算真正的降本。反过来,新模型虽然单价更高,却可能一次完成过去需要多轮调用才能完成的工作。所以我最近做了一项研究,换了一个视角:先用HumanEval、LiveCodeBench 和 SciCode的历史分数记录固定大模型的能力,再比较能够达到这个要求的模型中,token价格如何变化。结果很有意思。价格可能几个月不动,直到一个新的模型出现,突然把某一能力水平上的价格底线打到下一层。样本中的687次相邻月份比较里,共识别出124次降价,整体月度降价发生率约18%。很符合直觉的一点是,把价格打下来的,很多时候并不是原厂商自己降价。124次降价中,64.52%来自不同厂商发布新模型的竞争替代,贡献了80.10%的累计降幅;同一家厂商推出新模型替代旧模型占19.35%,原模型直接调价只有16.13%。假设一家企业原本主要使用某个海外旗舰模型做Coding,现在Kimi K3、GLM-5.2,甚至下一批新模型都能逐渐跨过它所要求的能力门槛,那么真正重要的就不再是原来的模型什么时候降价,而是有没有另一个供应商,能够用更低的成本提供足够好的能力?这两个问题看起来很像,背后的商业逻辑却完全不同。我们的数据还发现,满足同一能力要求的可选模型越多,下一月出现降价的可能性越高;当可选模型数量翻倍时,降价的相对可能性估计提高约41%。所以,新模型每跨过一个能力门槛,就可能让企业原本只有一两个比较强的大模型才能稳定完成的业务,突然变成三四家都能做。而选择一多,价格才真正开始竞争。这也让我觉得,到了 Agent 时代,企业可能需要重新理解AI 基础设施。现在值得建设建立一种快速适应机制来做降本增效:业务定义自己的能力门槛,底层同时保留多个合格模型,通过评测、路由和迁移机制,让模型之间可以替换。
发布于 辽宁
分享
1
2
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn