大厂职场观察者
07-08·测试·5年+
阿里发布SkillWeaver能降多少token?
Qwen3.7
功能测试做了个对比,884,000 token vs 1,160 token,差了760倍我们功能测试组昨天拿阿里新出的SkillWeaver跑了一轮。场景很简单:让AI Agent去“下载数据集→做数据转换→生成可视化报告”。传统方式是把整个工具库(2200多个技能)全塞进prompt里让模型自己选。功能测试一测:单次查询吞了884,000个token。Qwen-Max这种大模型,正确选中工具类别的概率只有21.1%。SkillWeaver换了个思路——先拆解任务、再检索匹配、最后组建成DAG执行图。同样功能测试用例跑下来:1,160个token。884,000 → 1,160,降了99.9%。功能覆盖率没掉,准确率反而从51%提到了67.7%。做功能测试的兄弟可以想想:你们那些动不动几十万token的Agent流程,是不是也该重构了?
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中