微学AI
08-13·AI领域创作者
GPT-6即将发布,你最期待哪些优化?
GPT-6能不能先把Agent做稳
最近我让AI改一个小项目,本来以为一句“修复登录异常并运行测试”就能结束,结果它改了接口、忘了更新类型,测试失败后又在同一个方向连续重试。那一刻我对GPT-6最大的期待突然很具体:别只会生成答案,要能稳定地完成任务。按我的期待排名,Agent可靠性第一,工具调用第二,自我验证第三。现在的模型已经能读代码、操作浏览器、调用API,真正的问题是长链路任务容易漂移:做着做着忘记目标,遇到报错开始碰运气,甚至执行了动作却说自己已经验证成功。GPT-6如果要让我惊喜,至少应该先拆解目标,记录每一步状态,调用工具后读取真实结果,失败时根据证据换方案,而不是继续猜。涉及删除文件、发邮件、付款这类高风险操作,还要在关键节点向用户确认。当前榜单里,顶级模型的推理分数已经很接近,下一场竞争未必是谁回答得更像专家,而是谁能连续工作几十分钟仍然不跑偏。要是GPT-6能把“说得对”升级成“做得完、查得清、出了错能回滚”,我愿意第一个付费。否则Agent再热闹,也只是会自己点击鼠标的聊天机器人。
发布于 福建
1
3
未登录
友善发言
image-upload
评论
加载中