微学AI
08-14·AI领域创作者
DeepseekHarness到底强在哪
Pi+DSH 凭什么登顶榜单
最近刷到 Composio 那组横向评测,我特意把表格存了下来。同一个 DeepSeek V4 Flash 模型,接进 Pi、Claude Code、Codex、Deep Agents 等八种 harness 各跑 30 个多步骤任务,单次成功任务成本最低 0.028 美元,最高 0.195 美元,差出近七倍。最狠的是缓存命中率,有开发者用 Pi 配 V4 Flash 跑了近 10 亿输入 token,命中率 99.93%,只花 2.65 美元,没缓存得 132 美元。DeepSeek Harness 这边的逻辑就是把重复上下文尽量往缓存通道推,极简模式只留 shell 和文件编辑两个工具专做基准测试,把 token 浪费压到最低。我算了下团队一个月的 agent 账单,真按这个命中率走能省一大半。但这榜也泼了我冷水:质量天花板那栏,社区还是把 Claude Code 排前面。DSH 赢的是每美元跑多快,不是绝对上限。你们压 agent 成本最头疼的是哪块?评论区聊聊。
发布于 福建
分享
评论
未登录
友善发言
image-upload
评论
加载中