宋宇寒
08-09 ·
国产旗舰模型扎堆,哪款最具性价比?
或许企业应该建立能够适应不同大模型的能力
可以感觉到最近GLM5.2和Kimi K3发布之后,获得同等 AI 能力的成本其实是在下降的。这个问题其实不能只看 Token 单价。假设一个模型便宜了一半,却无法完成原来的编程任务,那不能算真正的降本。反过来,新模型虽然单价更高,却可能一次完成过去需要多轮调用才能完成的工作。所以我最近做了一项研究,换了一个视角:先用HumanEval、LiveCodeBench 和 SciCode的历史分数记录固定大模型的能力,再比较能够达到这个要求的模型中,token价格如何变化。结果很有意思。价格可能几个月不动,直到一个新的模型出现,突然把某一能力水平上的价格底线打到下一层。样本中的687次相邻月份比较里,共识别出124次降价,整体月度降价发生率约18%。很符合直觉的一点是,把价格打下来的,很多时候并不是原厂商自己降价。124次降价中,64.52%来自不同厂商发布新模型的竞争替代,贡献了80.10%的累计降幅;同一家厂商推出新模型替代旧模型占19.35%,原模型直接调价只有16.13%。假设一家企业原本主要使用某个海外旗舰模型做Coding,现在Kimi K3、GLM-5.2,甚至下一批新模型都能逐渐跨过它所要求的能力门槛,那么真正重要的就不再是原来的模型什么时候降价,而是有没有另一个供应商,能够用更低的成本提供足够好的能力?这两个问题看起来很像,背后的商业逻辑却完全不同。我们的数据还发现,满足同一能力要求的可选模型越多,下一月出现降价的可能性越高;当可选模型数量翻倍时,降价的相对可能性估计提高约41%。所以,新模型每跨过一个能力门槛,就可能让企业原本只有一两个比较强的大模型才能稳定完成的业务,突然变成三四家都能做。而选择一多,价格才真正开始竞争。这也让我觉得,到了 Agent 时代,企业可能需要重新理解AI 基础设施。现在值得建设建立一种快速适应机制来做降本增效:业务定义自己的能力门槛,底层同时保留多个合格模型,通过评测、路由和迁移机制,让模型之间可以替换。
发布于 辽宁
分享
1
2
未登录
友善发言
image-upload
评论
加载中