大模型对比评测:谁强,谁省,谁适合什么场景

按 2026 年 7 月 1 日 DeepSWE v1.1 最新数据。所有模型跑同一套 mini-swe-agent,113 个工程题,91 个仓库,5 种语言。Pass@1 是单次通过率,Pass@4 是同一题跑 4 次至少过 1 次。

排行榜

排名 模型 最佳 effort Pass@1 Pass@4 平均成本/题 输出 token 步数
1 claude-fable-5 xhigh 69.9% 88.5% $13.41 80k 68
2 gpt-5-5 xhigh 67.0% 88.5% $7.23 46k 82
3 claude-opus-4-8 max 59.0% 79.3% $13.22 135k 120
4 claude-sonnet-5 max 53.8% 78.8% $26.40 214k 268
5 gpt-5-4 xhigh 51.8% 77.9% $5.65 71k 70
6 glm-5-2 max 43.8% 77.0% $3.92 78k 129
7 gemini-3-5-flash medium 37.4% 66.4% $7.34 276k 86
8 kimi-k2-7-code default 30.5% 61.1% $2.82 59k 149

以下 deepseek-v4-pro 只有 v1 数据,不在 v1.1 榜单内:

模型 版本 Pass@1 平均成本/题 输出 token 步数
deepseek-v4-pro v1 7.5% $4.22 50k 111

claude-fable-5

当前最强。Pass@1 69.9%,但不是靠蛮力堆出来的,平均步数才 68,头部最短。

不用每次都上 xhigh。low 59.6%,medium 65.4%,high 68.6%,xhigh 69.9%,max 69.7%。high 已经接近上限,成本 $9.18。

xhigh 多花 $4 只提 1.3 个点,max 分数反而跌了。

分语言:Go 73%,Python 68%,Rust 67%,JavaScript 65%,TypeScript 59%。没有明显偏科。

大部分任务开 high,特别难的仓库级改动上 xhigh,max 跳过。

gpt-5-5

最适合当主力的那个。xhigh 下 Pass@1 67.0%,只比第一低 2.9 个点,Pass@4 一样 88.5%,成本 $7.23,输出不过 46k。

但它很吃推理预算。low 只有 27.0%,不太够用。medium 54.0%,high 64.4%,xhigh 67.0%。给多少预算就出多少成绩。

语言:Go 61%,Python 51%,TypeScript 52%,JavaScript 39%,Rust 32%。和第一名的差距主要在 Rust 和 JavaScript,如果这两个语言的任务占大头,可能需要换模型。

普通开发开 medium,工程档开 high,最复杂的长链路开 xhigh。一个团队只选一个主力的话,它是最均衡的选择。

claude-sonnet-5

问题不在于弱,在于重。max 配置 Pass@1 53.8%,不算差,但成本 $26.40,输出 214k,步数 268。在头部模型里是最费钱的一档。

effort 曲线:low 30.5%,medium 39.8%,high 48.2%,xhigh 49.7%,max 53.8%。从 xhigh 到 max 只涨了 4.1 个点,成本翻了一倍多。

语言:Python 46%,TypeScript 46%,Go 44%,JavaScript 33%,Rust 32%。Python 和 TypeScript 成绩还行,其他语言掉得比较多。

偶尔用来攻最难的那几道题可以,挂主流程不合适。xhigh 和 max 之间选 max,因为 xhigh 只便宜一点但分数差一截。

glm-5-2

低价区间里最能打的。max 配置 Pass@1 43.8%,成本 $3.92,输出 78k,步数 129。

它只有两个 effort 档:

high 36.3%($2.84)和 max 43.8%($3.92)。从 high 到 max 提了 7.5 个点,只多花 $1.08,这笔买卖很划算,所以直接用 max 就行。

语言:Go 43%,TypeScript 41%,Python 40%,JavaScript 28%,Rust 28%。整体分布均匀,没有哪科特别偏,但也都没有特别优势。

适合题量大、容错高的场景,先批量铺题再人工兜底。如果预算有限又想保持一定通过率,它是当前性价比最好的选择。

kimi-k2-7-code

只有一个 effort 档,Pass@1 30.5%,成本 $2.82,输出 59k,步数 149。单题成本最低。

语言:Go 43%,其他语言掉得很快,JavaScript 25%,Python 24%,TypeScript 28%,Rust 15%。它在 Go 以外的语言上表现一般。

适合做前置分流,先大批量扫简单任务、生成初稿、探路,把真正难的任务转给更强模型。直接扛主流程不太现实。

gemini-3-5-flash

只有一个 medium 档,Pass@1 37.4%,成本 $7.34,输出 276k,步数 86。

这模型最大的问题是输出 token 爆高,276k。作为对比,claude-fable-5 的 xhigh 输出 80k,它的高 effort 版本也比别人多出一大截。在工程题上,它似乎需要说很多话才能达到目标。

语言:JavaScript 45%,Go 40%,Python 37%,TypeScript 35%,Rust 35%。JavaScript 表现相对最好,但整体分布偏平。

不适合当主力,输出 token 太多带来的延迟和成本很难预测。

deepseek-v4-pro (v1)

这个模型在 v1 就有数据,但没有进入 v1.1 榜单。v1 下 Pass@1 7.5%,成本 $4.22,输出 50k,步数 111。

7.5% 放在 v1.1 的语境里是最低一档,比 kimi-k2.7-code 还低很多。不过要注意它只跑了 v1 版本,v1 和 v1.1 的评分机制不同(v1.1 换了 committed diff + isolated verification),数字不能直接跨版本比。在 v1 里它排在倒数第三,高于 gemini-3-flash 和 qwen3.6-plus。

如果只看成本

glm-5-2 是当前最低成本还能有 40%+ 通过率的选项,$3.92。

gpt-5-4 卡在通过率和价格之间的平衡点,$5.65 拿 51.8%。

kimi-k2.7-code 成本最低但通过率也在最低一档,更适合做分流。gemini-3.5-flash 和 claude-sonnet-5 成本高且输出 token 爆炸,日常用不划算。

一句话总结

claude-fable-5 上限高,gpt-5-5 性价比高,glm-5-2 便宜好用,其余模型各有用处但都不太适合当唯一主力。