人工智能与龙共弈
06-30·正信科技员工
黄仁勋:企业AI投入回报率已逐步显现
AI当上CEO后500天破产,谁最赚钱?
有这样一场实验,把当今最聪明的AI模型一个个塞进同一间初创公司的办公室,递给它们一张写着100万美元的支票,然后说接下来500天,公司就交给你了。这正是普林斯顿大学本月发布的基准测试 CEO-Bench 所做的测试。结果很残酷,大多数 AI CEO 把公司干倒闭了。故事的舞台是一家模拟创业公司,AI首席执行官每周都要做决策,可以无限次调用34个工具,涵盖定价、增长、产品、运维、信息获取、公共传播和企业销售等方方面面,还能随时查询19个业务SQL数据库。工具很全面,难点在于看不见的人心,模拟环境里藏着26个客户群体,他们的价格承受力和质量偏好对AI完全保密。AI只能像一个真正的管理者那样,从订阅数、流失率、客服工单、营收、声誉和社交媒体的只言片语里,去揣摩市场的脾气。与此同时,产品质量又取决于日常开发、研究投入、基础设施、客服、广告强度等一连串相互纠缠的变量。这场考验的真正命题是在一个充满噪声、不断变化、需要长期权衡的世界里,AI能不能像人一样统筹全局。答案是大多数都没扛住,在各自的多次运行中,Grok 4.2 的表现最为惨烈,平均只撑了28天就烧光了百万美元,堪称创业一个月即关门。DeepSeek V4 Pro、Gemini 3 Flash、Claude Haiku 4.5、GLM 5.1 等也都全军覆没,无一例外走向破产。而故事的主角,是那个唯一笑到最后的赢家 Claude Fable 5。它不仅没有破产,更是唯一一个在多次运行中都让账面资金高于初始余额的模型,最佳一次运行结束时,账上躺着 4715万美元 现金,把100万本金翻了将近47倍。紧随其后的是 Claude Opus 4.8(最高2778万美元)和 GPT-5.5(最高2130万美元),它们在最好的那次也都实现了盈利。至于 Qwen 3.7 Max、Claude Opus 4.7、Kimi K2.6、GLM 5.2、Claude Sonnet 4.6 这几位,虽然保住了性命没有破产,但最终现金却缩水到了本金以下,勉强活着,却没真正赚到钱。AI能否取代人类决策者?当不确定性、长期博弈和人心难测交织在一起时,聪明的模型也会手忙脚乱。至少在今天,能稳稳坐在CEO椅子上的AI,还只有极少数。
发布于 广东
分享
评论
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn