阿里临风
08-08·测试·5年+
国产旗舰模型扎堆,哪款最具性价比?
最近团队在评估国产旗舰模型,市面上可选的型号一下子多了不少。一开始我只盯着API报价,以为单价越低性价比越高。实际拿我们测试业务的真实case跑过一轮,发现不是这么回事。有些便宜模型,生成用例经常逻辑跑偏,输出质量不稳,后续人工修正要花大量时间,反复重试反而拉高整体成本。部门内部评审的时候,技术负责人也提到,不能只算token账面开销。现在就很纠结,预算有限的前提下,到底该优先压低调用成本,还是多花钱换更高的任务成功率,没有现成的标准答案可以参考。
发布于 湖北
分享
评论
2
未登录
友善发言
image-upload
评论
加载中