贵的打不过便宜的8 款 AI 编程 Agent 实测横评通过率最高的成本居然只有别人的五分之一当所有人都在卷谁的模型更聪明时一张基准测试表揭开了另一个真相决定 Agent 好不好用的可能不是智商而是性价比曲线站在哪一头。一、一张表撕开 AI 编程工具的遮羞布最近一份针对主流 AI 编程 Agent 的基准测试结果流出8 款工具同台竞技比的维度很简单也很残酷通过率Pass rate给真实编程任务一次做对的比例中位耗时Median time完成一个任务要多久单次成功成本Cost per success平均搞定一件事要花多少钱结果如下排名Harness通过率中位耗时单次成功成本Pi Agent66.7%132.2s$0.038Prime Agent62.5%*242.1s$0.131OMP56.7%272.4s$0.1034Claude Code53.3%122.7s$0.1955Codex53.3%246.0s$0.0816DeepAgents53.3%187.1s$0.0457Hermes Agent50.0%175.5s$0.0568OpenCode46.7%123.7s$0.073二、三个反常识的发现发现 1第一名是断层式领先Pi Agent 的通过率 66.7%比第二名高出 4.2 个百分点比最后一名高出整整20 个百分点。更夸张的是成本——单次成功仅 $0.038是 Claude Code 的1/5是 Prime Agent 的1/3.4比自家身后的所有对手都便宜又强、又快、又便宜——过去这被认为是不可能三角这份数据里它被同时实现了。通过率第一的同时132.2s 的中位耗时也只比最快的 Claude Code 慢了不到 10 秒。发现 2最快的往往不是最强的速度榜前三名Claude Code — 122.7sOpenCode — 123.7sPi Agent — 132.2s但 Claude Code 通过率只有 53.3%OpenCode 更是垫底46.7%。快但没快出结果——这可能意味着它们倾向于更快给出答案而不是更多轮次地自我验证和修正。反观通过率前两名耗时都排在中游偏上。这暗示了一个朴素的工程规律多想想再动手。发现 3同分不同命——成本差距最高达 4 倍最有意思的是中间梯队Claude Code、Codex、DeepAgents 三款工具通过率完全相同53.3%但单次成功成本分别是Claude Code$0.195Codex$0.081DeepAgents$0.045同样的成功率成本差距超过4 倍。如果你按月跑上千个任务这个差距就是实打实的账单差异。选工具时只看通过率可能正在花冤枉钱。三、怎么选一张决策地图不同需求的人应该看不同的列追求成功率任务不能失败比如生产环境修复→ 首选 Pi Agent66.7% 通过率断层领先。追求极致速度快速原型、探索性任务→ Claude Code 和 OpenCode 都在 125 秒以内但要接受通过率打八折。追求批量成本控制团队规模化使用→ 看单次成功成本这一列Pi Agent$0.038和 DeepAgents$0.045是第一梯队。注意 Hermes Agent 标注了 $0.056加号意味着实际成本可能更高。综合均衡型→ Pi Agent 几乎是唯一在三个维度都站在前列的选手。四、冷静一下几个必须保留的疑问在转发这张表之前有几点值得提醒测试集是什么不同基准SWE-bench、Terminal-Bench 或自建任务集结果差异巨大脱离测试集谈排名意义有限。Prime Agent 的星号62.5%*和 Hermes 的加号$0.056意味着什么数据标注往往藏着关键前提。单次测试的样本量。46.7% 到 66.7% 的差距在小样本下可能只是统计噪声。中位耗时掩盖了长尾。有些 Agent 快是因为放弃了难题有些慢是因为在死磕。五、结语Agent 竞争的下半场拼的是经济学这轮 AI 编程工具的竞争上半场比的是能不能做对下半场比的显然是做对的代价。当通过率逐渐触及天花板真正拉开差距的将是单位成本下的成功密度、失败时的优雅降级、以及长任务中的稳定性。从这个角度看这张表最有价值的不是排名本身而是它把成本这个过去被忽略的维度放到了和能力同等的位置。毕竟对企业来说问题从来不是哪个 Agent 最聪明而是——“同样一笔预算谁能帮我解决最多的问题”注本文数据基于流传基准测试图表仅供选型参考建议结合自身任务类型实测验证。