霍格沃兹测试开发学社
07-11 · 北京测吧
AI Agent 评测与可观测性(二)
二、“锚-盾-眼”:SDD 评测体系的三重奏模型刘振凯老师将在分享中系统阐述 SDD 评测的 “锚-盾-眼”三重奏模型。这套模型可以理解为 AI 工程质量治理中的三个关键支点。线下评测是“锚”线下评测用于建立质量基线。它帮助团队判断当前模型、Agent、Skill、Prompt、流程编排到底处于什么水平。只有先建立基线,后续模型升级、工具调整、流程优化,才有可比较、可验证的依据。线上评审是“盾”线上评审用于守住过程质量。AI 在真实研发流程中运行时,输入更复杂,任务更动态,风险也更难提前覆盖。这时就需要在线上通过实时评审机制,形成质量门禁,避免低质量产物直接进入后续研发环节。可观测性是“眼”可观测性用于看清 Agent 的执行过程。包括任务拆解、上下文使用、工具调用、Skill 执行、Token 消耗、异常节点、链路时序等。它让原本不可见的 AI 执行过程变成可分析、可度量、可优化的数据资产。这三者不是孤立存在的。线下评测解决“有没有质量标准”; 线上评审解决“过程是否可控”; 可观测性解决“问题是否看得见、追得回、改得动”。最终形成一个完整闭环:评测 → 评审 → 观测 → 回流这也是 AI 研发质量体系从“事后验证”走向“全程体检”的关键路径。三、从“结果导向”到“过程可溯”很多团队刚开始做大模型评测时,容易把评测理解为“看最终答案对不对”。但在真实工程场景中,只看结果远远不够。尤其是在 SpecDrivenDev 这类围绕规格、需求、设计、实现、验证展开的研发模式中,AI 不只是生成一段文本或代码,而是在参与整个研发链路。这意味着评测维度必须从单一结果,扩展到过程质量。比如:需求理解是否准确? 任务拆解是否合理? 上下文引用是否充分? Skill 调用是否匹配任务目标? 工具执行结果是否被正确理解? 生成内容是否符合规格约束? 异常场景是否有识别和处理? 中间步骤是否可追踪? 最终结果是否能回溯到输入依据?当 AI Agent 介入研发流程之后,真正有价值的评测不应该只停留在“这次答案对不对”,而要进一步回答:它为什么会得到这个答案? 这个答案是否稳定可复现? 如果错了,错在哪一个环节? 下一轮如何让系统自动变得更好?这也是从“暗箱”走向“透镜”的核心变化。
发布于 北京
1
评论
赞
未登录
友善发言
评论
加载中
下载脉脉APP,成就职业梦想
违法不良信息&未成年人有害信息举报电话/客服电话:400 065 0808
违法不良信息&未成年人有害信息举报邮箱/客服邮箱:maimai@taou.com
清朗系列专项行动相关违规信息举报电话:400 065 0808,举报邮箱:maimai@taou.com
个人/企业等被诽谤侮辱、人身权或知识产权等被侵犯、网络谣言的举报地址:maimai.cn/tousu | 涉企虚假不实信息举报投诉专区
京ICP备12005786号-1copyright©maimai.cn