大模型对比评测:谁强,谁省,谁适合什么场景
按 2026 年 7 月 1 日 DeepSWE v1.1 最新数据。所有模型跑同一套 mini-swe-agent,113 个工程题,91 个仓库,5 种语言。Pass@1 是单次通过率,Pass@4 是同一题跑 4 次至少过 1 次。
排行榜
| 排名 | 模型 | 最佳 effort | Pass@1 | Pass@4 | 平均成本/题 | 输出 token | 步数 |
|---|---|---|---|---|---|---|---|
| 1 | claude-fable-5 | xhigh | 69.9% | 88.5% | $13.41 | 80k | 68 |
| 2 | gpt-5-5 | xhigh | 67.0% | 88.5% | $7.23 | 46k | 82 |
| 3 | claude-opus-4-8 | max | 59.0% | 79.3% | $13.22 | 135k | 120 |
| 4 | claude-sonnet-5 | max | 53.8% | 78.8% | $26.40 | 214k | 268 |
| 5 | gpt-5-4 | xhigh | 51.8% | 77.9% | $5.65 | 71k | 70 |
| 6 | glm-5-2 | max | 43.8% | 77.0% | $3.92 | 78k | 129 |
| 7 | gemini-3-5-flash | medium | 37.4% | 66.4% | $7.34 | 276k | 86 |
| 8 | kimi-k2-7-code | default | 30.5% | 61.1% | $2.82 | 59k | 149 |
以下 deepseek-v4-pro 只有 v1 数据,不在 v1.1 榜单内:
| 模型 | 版本 | Pass@1 | 平均成本/题 | 输出 token | 步数 |
|---|---|---|---|---|---|
| deepseek-v4-pro | v1 | 7.5% | $4.22 | 50k | 111 |
claude-fable-5
当前最强。Pass@1 69.9%,但不是靠蛮力堆出来的,平均步数才 68,头部最短。
不用每次都上 xhigh。low 59.6%,medium 65.4%,high 68.6%,xhigh 69.9%,max 69.7%。high 已经接近上限,成本 $9.18。
xhigh 多花 $4 只提 1.3 个点,max 分数反而跌了。
分语言:Go 73%,Python 68%,Rust 67%,JavaScript 65%,TypeScript 59%。没有明显偏科。
大部分任务开 high,特别难的仓库级改动上 xhigh,max 跳过。
gpt-5-5
最适合当主力的那个。xhigh 下 Pass@1 67.0%,只比第一低 2.9 个点,Pass@4 一样 88.5%,成本 $7.23,输出不过 46k。
但它很吃推理预算。low 只有 27.0%,不太够用。medium 54.0%,high 64.4%,xhigh 67.0%。给多少预算就出多少成绩。
语言:Go 61%,Python 51%,TypeScript 52%,JavaScript 39%,Rust 32%。和第一名的差距主要在 Rust 和 JavaScript,如果这两个语言的任务占大头,可能需要换模型。
普通开发开 medium,工程档开 high,最复杂的长链路开 xhigh。一个团队只选一个主力的话,它是最均衡的选择。
claude-sonnet-5
问题不在于弱,在于重。max 配置 Pass@1 53.8%,不算差,但成本 $26.40,输出 214k,步数 268。在头部模型里是最费钱的一档。
effort 曲线:low 30.5%,medium 39.8%,high 48.2%,xhigh 49.7%,max 53.8%。从 xhigh 到 max 只涨了 4.1 个点,成本翻了一倍多。
语言:Python 46%,TypeScript 46%,Go 44%,JavaScript 33%,Rust 32%。Python 和 TypeScript 成绩还行,其他语言掉得比较多。
偶尔用来攻最难的那几道题可以,挂主流程不合适。xhigh 和 max 之间选 max,因为 xhigh 只便宜一点但分数差一截。
glm-5-2
低价区间里最能打的。max 配置 Pass@1 43.8%,成本 $3.92,输出 78k,步数 129。
它只有两个 effort 档:
high 36.3%($2.84)和 max 43.8%($3.92)。从 high 到 max 提了 7.5 个点,只多花 $1.08,这笔买卖很划算,所以直接用 max 就行。
语言:Go 43%,TypeScript 41%,Python 40%,JavaScript 28%,Rust 28%。整体分布均匀,没有哪科特别偏,但也都没有特别优势。
适合题量大、容错高的场景,先批量铺题再人工兜底。如果预算有限又想保持一定通过率,它是当前性价比最好的选择。
kimi-k2-7-code
只有一个 effort 档,Pass@1 30.5%,成本 $2.82,输出 59k,步数 149。单题成本最低。
语言:Go 43%,其他语言掉得很快,JavaScript 25%,Python 24%,TypeScript 28%,Rust 15%。它在 Go 以外的语言上表现一般。
适合做前置分流,先大批量扫简单任务、生成初稿、探路,把真正难的任务转给更强模型。直接扛主流程不太现实。
gemini-3-5-flash
只有一个 medium 档,Pass@1 37.4%,成本 $7.34,输出 276k,步数 86。
这模型最大的问题是输出 token 爆高,276k。作为对比,claude-fable-5 的 xhigh 输出 80k,它的高 effort 版本也比别人多出一大截。在工程题上,它似乎需要说很多话才能达到目标。
语言:JavaScript 45%,Go 40%,Python 37%,TypeScript 35%,Rust 35%。JavaScript 表现相对最好,但整体分布偏平。
不适合当主力,输出 token 太多带来的延迟和成本很难预测。
deepseek-v4-pro (v1)
这个模型在 v1 就有数据,但没有进入 v1.1 榜单。v1 下 Pass@1 7.5%,成本 $4.22,输出 50k,步数 111。
7.5% 放在 v1.1 的语境里是最低一档,比 kimi-k2.7-code 还低很多。不过要注意它只跑了 v1 版本,v1 和 v1.1 的评分机制不同(v1.1 换了 committed diff + isolated verification),数字不能直接跨版本比。在 v1 里它排在倒数第三,高于 gemini-3-flash 和 qwen3.6-plus。
如果只看成本
glm-5-2 是当前最低成本还能有 40%+ 通过率的选项,$3.92。
gpt-5-4 卡在通过率和价格之间的平衡点,$5.65 拿 51.8%。
kimi-k2.7-code 成本最低但通过率也在最低一档,更适合做分流。gemini-3.5-flash 和 claude-sonnet-5 成本高且输出 token 爆炸,日常用不划算。
一句话总结
claude-fable-5 上限高,gpt-5-5 性价比高,glm-5-2 便宜好用,其余模型各有用处但都不太适合当唯一主力。