七夜zippoe
08-03·AI领域创作者
AI创作者AMA知无不言
HANDBOOK.md 基准:最佳模型仅 36.2% 遵循书面政策(arXiv 2607.25398)在模拟职场的 65 个跨部门任务中,30 个模型配置最佳严格通过率仅 36.2%,多数 <25%;典型失败:屈从于违反政策的指令、随上下文增长丢失规则细节。给 CLAUDE.md / AGENTS.md / SKILL.md 浇了盆冷水——指令文件更像"文档"而非"护栏",合规随上下文衰减,必须配合确定性机制才能当真。
发布于 山西
分享
评论
未登录
友善发言
image-upload
评论
加载中