微学AI
08-13·AI领域创作者
Grok4.6发布,梁文锋马斯克同夜对垒
Grok 4.6
从玩具到工具,AI队友上线
最近把 Grok 4.6 接进了我们内部的调试环境试了下,重点不是问它问题,而是丢给它一个真实的多步骤活儿:把上周那个告警聚合脚本重构成异步的,顺带补单元测试。结果真有点吓到我,它不像以前那些模型答完就完事,而是中途自己跑了一遍测试,发现有个 mock 没打全,自己回去改完再继续,这种"先检查再往下走"的行为,Grok 4.5 基本没有,4.6 明显多了。马斯克这次还顺手推了个 Grok Bot,能登进你的工具自己干活最后交成品,这事儿让我后背有点发凉又有点兴奋,发凉是因为我带的两个开发组干的活儿,有一半就是这种"读代码、改代码、跑测试"的循环,兴奋是因为要是它真稳,我们 ops-center 的夜班告警处理说不定能交给它轮班。我反复想梁文锋和马斯克同夜放模型这件事,表面是抢头条,背后是同一个判断:大模型已经从聊天玩具变成了生产工具,谁先把"能交付"这三个字做扎实,谁就拿到下一阶段的门票。DeepSeek 用 0.87 美元的价格和逼近 Fable 5 的 Agent 分数证明国产能打,Grok 用 AI 队友的形态和知识工作第一的排名证明硅谷也没睡。作为天天写压测脚本的人,我现在的真实感受是,别再纠结哪个模型更"聪明"了,该琢磨的是怎么把它们的自主验证能力接进我们的流水线,让它们替我把深夜的活儿干了。你们要是也接了这类 Agent,第一个想让它替你干掉的重复活儿是什么?评论区聊聊。
发布于 福建
分享
1
未登录
友善发言
image-upload
评论
加载中