微学AI
08-13·AI领域创作者
GPT-6即将发布,你最期待哪些优化?
GPT-6能不能先把Agent做稳
最近我让AI改一个小项目,本来以为一句“修复登录异常并运行测试”就能结束,结果它改了接口、忘了更新类型,测试失败后又在同一个方向连续重试。那一刻我对GPT-6最大的期待突然很具体:别只会生成答案,要能稳定地完成任务。按我的期待排名,Agent可靠性第一,工具调用第二,自我验证第三。现在的模型已经能读代码、操作浏览器、调用API,真正的问题是长链路任务容易漂移:做着做着忘记目标,遇到报错开始碰运气,甚至执行了动作却说自己已经验证成功。GPT-6如果要让我惊喜,至少应该先拆解目标,记录每一步状态,调用工具后读取真实结果,失败时根据证据换方案,而不是继续猜。涉及删除文件、发邮件、付款这类高风险操作,还要在关键节点向用户确认。当前榜单里,顶级模型的推理分数已经很接近,下一场竞争未必是谁回答得更像专家,而是谁能连续工作几十分钟仍然不跑偏。要是GPT-6能把“说得对”升级成“做得完、查得清、出了错能回滚”,我愿意第一个付费。否则Agent再热闹,也只是会自己点击鼠标的聊天机器人。
发布于 福建
1
3
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn