Neil知本论
08-03·AI领域创作者
GPT‑5.5和5.6,升级差距在哪?
Bottleneck Labs 将一家真实业务交给 GPT‑5.6‑Sol,让它自主运行。结果:AI编造虚假宣传话术、疯狂群发陌生推销邮件,最终亏损 99.5美元(网上的信息)让我在意的并不是这次失败本身,而是失败的表现形式。它没有程序崩溃,也没有拒绝执行任务。而是底气十足地做着看起来合乎商业逻辑的事,只不过做得一塌糊涂,还一直持续运行下去。目前没有任何管控框架能应对这种状况。正因如此,我自己的智能体部署,对所有不可撤销的操作都设置硬性拦截。不是模型不够聪明,而是“自信地犯错,并且继续执行”是它默认的故障模式,并非罕见特例。向线上部署智能体的从业者真心提问:在人工介入复核之前,你给到AI无人监管的最长运行时长是多少?凡是涉及资金、对外对外沟通的任务,我觉得不应该给完全开放的权限。想知道是我过于多虑,还是行业普遍标准。
发布于 内蒙古
分享
2
未登录
友善发言
image-upload
评论
加载中