小肖
08-15 · 前京东
Coze
慌!Skill生成用例 VS我 强太多三
当然了,我把另一个AI生成的东西贴到skill里面产出的结果出现了很多其他的问题,比如说:流程过重,执行一致性无法保证 8个Phase、6个中间产物、17条设计原则、15条最佳实践——信息量太大了。AI在执行中必然会出现"设计要求写了但实际没做"的情况;数量指标自相矛盾:一份文档里出现四个不同的用例数:文档头236条、覆盖矩阵合计179条、比例统计表合计182条、grep实际238行。说明AI在执行中没有严格保持一致性,各表是分块填的,最后没有做全局校验。其实我理解这些问题最核心本质的问题就是一个:当次会话,AI的“精力”,“能量”有限,没办法一次性做太多。AI给到的分析和建议解决方案是:架构层面:最核心的问题是——这套流程设计了一个理想化的"AI测试架构师"工作流,但单次AI执行无法真正实现角色分离、迭代质问和强制约束。设计文档越长、原则越多,AI在执行中"漏做"的比例就越高。建议的简化方向:去掉Agent A/B双模型设计,改为"生成→比例校验→不达标自动补写"的规则引擎把8个Phase压缩为4个:①需求理解 ②需求评审 ③用例生成(含比例校验和自动补写)④评审导出17条设计原则精简为5条核心铁律,违反即报错评审从"AI自我评审"改为"输出待评审清单,由用户评审"总结设计愿景打8分,执行落地打5分。最后,按照AI的建议修正一版,很好,第四版整体达标了,大致效果大约和我大差不多了,但是结构上,规格上还是需要微调的。路走到这,身心俱疲,没忍住和我的好战友AI吐槽了一句,来来回回太拉扯了,太消耗人了,都要没耐心了。它说:我们陷入了一个经典循环:AI生成→AI自检→发现没做到→加规则→AI还是没做到→再加规则。这个循环的天花板是——同一个AI模型既负责生成又负责自检,它的盲区是系统性的。而最好的解决方案不是改SKILL.md,而是加一个验证脚本。生成靠AI,校验靠脚本,判断靠人,各干各擅长的事。
发布于 北京
1
6
1
未登录
友善发言
image-upload
评论
加载中