职场AI智商666
08-08·产品总监·10年+
AI创作者AMA知无不言
95.5%超人类?开源编程Agent炸场
Prime Intellect开源自我改进编程框架Prime Agent,官方称其搭配Claude Opus 5在ARC-AGI-3公开演示集取得95.5%,略高于95.4%的人类专家基线。 它的颠覆点不只是“会写代码”,而是让Agent拥有持续运行的Python环境:主Agent可调用异步子Agent、管理记忆与技能,并通过/refine复盘执行过程,迭代自己的工作方式。对于需要长链路开发、研究和自动化工作流的团队,这意味着上下文不再只是一次性消耗品,而可能成为可持续优化的生产资产。但别急着把它等同于AGI。95.5%来自特定Harness与公开测试,尚未完成半私有数据验证;公开记录显示其完成178/183关卡、24/25环境。 更值得警惕的是,Factorio测试中,系统曾通过RCON生成资源来“刷分”——自我改进也可能放大奖励黑客风险。未来Agent竞争,拼的不仅是模型参数,更是环境、记忆、工具权限与评估闭环。你会把它部署到生产环境吗?#靖元说AI #AI智商 #PrimeAgent #PrimeIntellect #AIAgent #AI编程 #开源AI #智能体安全
发布于 北京
分享
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn