我的香菜呢
08-15·项目管理·4年
DeepseekHarness到底强在哪
DeepSeek昨晚发了Harness,朋友圈一片Claude Code杀手的喊声。但如果你只把它当成一个编程工具,就小看了这步棋。先说一个关键数据。行业做过一个评测同一个模型放进8个不同的Harness框架跑30个任务,总共运行240次,只有129次成功。30个任务里只有6个被所有框架完成。成本差距更夸张,同样完成16个任务,Claude Code每个成功任务成本0.195美元,Codex是0.081美元,DeepAgents只要0.045美元。同一个模型,差了四倍。模型划定能力上限,但Harness决定这份上限能兑现多少、花多少钱兑现。上下文留什么丢什么、什么时候调哪个工具、报错了重试还是换路、模型说完了信不信要不要再验一遍,任何一步处理不好,模型思路再对也白搭。
发布于 北京
分享
评论
1
未登录
友善发言
image-upload
评论
加载中