为人民谋幸福的小陈
08-18·AI领域创作者
通用大模型榜:模型观察员任务
最近测试了几款国产和海外大模型,最大的感受是:已经不能简单用“谁更聪明”来评价了。写代码的时候,有些国产模型已经非常能打;中文办公、总结会议、写材料,甚至有些场景体验比海外模型还顺。但到了复杂推理、多轮任务、长上下文的时候,差距还是会暴露出来。更有意思的是,同一个问题我换5个模型问,答案能完全不一样。所以现在我越来越不相信所谓的“模型排行榜”。真正有价值的不是哪个模型总榜第一,而是:你的工作场景到底应该选哪个模型?写代码、做PPT、分析Excel、写报告、做研究,可能根本没有一个模型能全部第一。你们现在主力用哪个大模型?有没有哪个模型让你用了以后彻底回不去了?
发布于 广东
分享
1
未登录
友善发言
image-upload
评论
加载中