张勉
08-09 · 智核人工智能开发工作室创始人前合纵文化集团·总监
KDD2026现场 | 济州岛 ICC
今天完成了《ReflexBench》的 Presentation。  为什么很多 AI Agent 离线测试很完美,一上线就崩?因为现有评估大多把 Agent 当成“静态观察者”,忽略了Agent 自己的输出会改变后续环境与数据(比如预测股市改变了交易,推荐系统改变了用户偏好)。  这次在 KDD 交流的两个核心框架:1️⃣ ReflexBench:测量 Agent 在递归反馈下的“反思性失效”,并提供部署前压测与运行中的监控机制。2️⃣ Cognitive Immunity:无需重训练基座模型,在系统层构建可审计故障记忆的运行时安全屏障。  现场与多家大厂及高校学者完成了对齐,完整 Paper 与项目库正在公开整理中,欢迎同频的开发者与研究者随时沟通!  #KDD2026 #AI Agent #大模型 #学术会议 #人工智能
发布于 韩国
分享
评论
未登录
友善发言
image-upload
评论
加载中