汤姆在大连敲代码
08-14·转转员工
Grok 4.6
Grok4.6发布!性能究竟如何?
没有自己的回归集,先别谈“追平”
在跑完自己的任务之前,我不会根据一张总榜写“Grok 4.6 已经追平谁”。综合分数相同,可能只是平均值刚好接近。代码修改、中文理解、实时搜索和工具调用是完全不同的能力,混成一个数字,对选型帮助有限。如果让我评 Grok 4.6,我会准备几组差异很大的任务:一组修复真实代码仓库里的历史问题,一组连续调用工具完成资料整理,再放进中文业务文档和需要核对来源的实时信息。每个任务至少重复几次,记录完成率、人工修改时间、P95 时延、Token 消耗和错误操作次数。Grok 与 X 平台结合,理论上在实时信息场景里有优势,但“搜得快”不等于“信息可靠”。来源质量、广告和情绪内容、提示注入,以及搜索结果之间的冲突,都需要单独测试。如果业务根本不依赖实时信息,这项优势也未必能转化成价值。所以我现在最多会把它加入候选模型,先通过路由承接合适的任务,不会直接替换现有主模型。公开跑分负责告诉我“值得测一下”,真实业务才负责决定要不要付钱。
发布于 北京
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn