梁漩智
07-05 · 前北京与爱为舞科技有限公司
这两天翻脉脉上的 AI Agent 岗位,我注意到一个变化:不少 JD 已经不先写模型能力,而是先写评测集、回归测试、可观测和调度系统。Anthropic 6 月提到,Mythos 5 的部分高风险能力先只放进 Project Glasswing,交给少量网络防御方和基础设施提供方。我理解这不是保守,而是一个很现实的信号:能力越强,越要先放进可评测、可回放、可追责的环境里。所以我判断一个团队的 AI 是否真的进了生产,不先听它有多少 Agent,而看三件事有没有写死:固定评测集、版本升级后的自动回归、同类错误的回放复盘。这三样没立住,再多 Agent 也只是把 Demo 放大。#AI落地 #AIAgent #评测体系 #回归测试
发布于 上海
2
1
1
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn