迷你兔 大模型排行榜 数据快照2026-09-20
LLM Leaderboard · 大模型排行榜

全球大模型 六维横评 · 谁最强一榜看懂

收录 Arena 对战 Elo 最高的 100 个大模型,从对战人气、编程、视觉、智能指数、知识储备到解题能力六个维度打分。点击列头排序,支持按开源 / 国产筛选。

100
收录模型
Arena Elo Top 100
39
国产模型上榜
智谱 / 阿里 / DeepSeek / 月之暗面…
33
开源 / 开放权重
MIT · Apache 2.0 等
Claude Fable 5.1
当前榜首 ·Anthropic
Arena Elo 1520 · AAII 53

Arena Elo · 前十强

真人盲测对战评分 · 条长代表实力 · 国产模型橙色
Anthropic Google OpenAI 阿里 Qwen xAI DeepSeek 其他厂商 悬停柱子查看详情

综合排行榜 · Top 100

默认按 Arena Elo 降序 · 点击列头切换排序
显示100 / 100 个模型
# 模型 Arena Elo 编程 视觉 智能指数 MMLU-Pro ARC-AGI
1
Claude Fable 5.1
Anthropic · Proprietary
1520157013155392.490.0
2
GPT-6 Astra
OpenAI · Proprietary
1520156813165392.095.0
3
Claude Opus 5
Anthropic · Proprietary
1511156613145191.690.4
4
Claude Fable 5
Anthropic · Proprietary
1510156613125091.589.2
5
GPT-5.6 Sol
OpenAI · Proprietary
1509156713124790.292.5
6
Grok-4.6
xAI · Proprietary
1507156313104789.675.0
7
Muse Spark 1.3
Meta · Proprietary
1507156213104789.0—
8
Kimi-K3 ✅
Moonshot · Kimi K3 开源国产
1506156213114689.3—
9
Claude Opus 4.8 Thinking
Anthropic · Proprietary
1506156213104590.178.0
10
Qwen3.8-Max ✅
Alibaba · Qwen3 开源国产
1506156013124589.8—
11
GPT-5.6 Terra
OpenAI · Proprietary
1505156213104489.683.9
12
Gemini-3.8-Flash
Google · Proprietary
1505156113124590.280.6
13
GPT-5.5-high
OpenAI · Proprietary
1505156113114489.685.0
14
GLM-5.3 ✅
Z.ai · MIT 开源国产
15051560—4587.8—
15
Claude Opus 4.7 Thinking
Anthropic · Proprietary
1504155913094390.075.8
16
Grok-4.5
xAI · Proprietary
1504155613054389.5—
17
Gemini-3.1-Pro
Google · Proprietary
1504153113094391.077.1
18
Claude Opus 4.8
Anthropic · Proprietary
1503155813064290.062.2
19
DeepSeek-V4.1-Flash
DeepSeek · MIT 开源国产
15031557—4387.4—
20
Gemini-3.7-Flash
Google · Proprietary
1503155613034390.0—
21
Claude Opus 4.7
Anthropic · Proprietary
1502155413004189.962.1
22
DeepSeek-V4-Pro
DeepSeek · MIT 开源国产
15021550—4187.5—
23
Claude Opus 4.6 Thinking
Anthropic · Proprietary
1502154513044189.769.2
24
Muse Spark 1.2
Meta · Proprietary
1502154013004388.8—
25
Gemini-3.6-Flash
Google · Proprietary
1501153513014190.072.1
26
GPT-5.4-high
OpenAI · Proprietary
1496153812904188.674.0
27
Muse Spark 1.1
Meta · Proprietary
1496152112984188.7—
28
Grok-4.20
xAI · Proprietary
1495151812794188.665.1
29
Gemini-3-Pro
Google · Proprietary
1492150113084190.033.6
30
Claude Opus 4.6
Anthropic · Proprietary
1490153512984089.564.6
31
GLM-5.2
Z.ai · MIT 开源国产
14881525—4187.522.8
32
Qwen3.7-Max
Alibaba · Proprietary 国产
1486150512894189.6—
33
Claude Sonnet 5 Thinking
Anthropic · Proprietary
1485152012854189.0—
34
Muse Spark
Meta · Proprietary
1484149312944087.3—
35
Grok-4.1-Thinking
xAI · Proprietary
14821483—3988.226.0
36
ERNIE-5.1
Baidu · Proprietary 国产
14751495—4087.1—
37
Claude Opus 4.5 (thinking-32k)
Anthropic · Proprietary
14691510—3989.530.6
38
Claude Sonnet 4.6 Thinking
Anthropic · Proprietary
1468151112784088.060.4
39
GLM-5.1
Z.ai · MIT 开源国产
14671506—4087.15.1
40
Seed2.0 Pro
ByteDance · Proprietary 国产
1466149512883987.8—
41
Kimi-K2.6-Thinking
Moonshot · Modified MIT 开源国产
1466149312864087.3—
42
Qwen3.5-Max
Alibaba · Proprietary 国产
14661493—3987.8—
43
MiMo-V2.5-Pro
Xiaomi · MIT 开源国产
14661485—3987.0—
44
GPT-5.2-high
OpenAI · Proprietary
1465147012804187.552.9
45
Gemini-3-Flash
Google · Proprietary
1465146912924089.031.1
46
GPT-5.4
OpenAI · Proprietary
1465146812753988.429.2
47
GPT-5.1-high
OpenAI · Proprietary
1464146612503987.117.6
48
GPT-5.2
OpenAI · Proprietary
1464146512483787.426.7
49
Grok-4.1
xAI · Proprietary
14631463—3788.0—
50
Claude Opus 4.5
Anthropic · Proprietary
14621496—3188.87.8
51
GPT-5.4-mini-high
OpenAI · Proprietary
14611461—3787.018.9
52
Claude Sonnet 4.6
Anthropic · Proprietary
1460150012773587.337.6
53
Gemini-2.5-Pro
Google · Proprietary
1459146512663486.24.9
54
ERNIE-5.0
Baidu · Proprietary 国产
1458146112513586.0—
55
Qwen3.6-Plus
Alibaba · Proprietary 国产
14561482—3988.5—
56
Minimax-M3
MiniMax · Non-commercial 国产
14521485—3987.2—
57
GLM-5
Z.ai · MIT 开源国产
14521461—3987.05.0
58
Kimi-K2.5-Thinking
Moonshot · Modified MIT 开源国产
1451148012713887.111.8
59
DeepSeek-V4-Flash
DeepSeek · MIT 开源国产
14511466—3986.261.4
60
GPT-5.6 Luna
OpenAI · Proprietary
14511465—3986.159.5
61
Qwen3.8-27B
Alibaba · Apache 2.0 开源国产
14501465—3986.3—
62
Qwen3.5-397B-A17B
Alibaba · Apache 2.0 开源国产
14501463—3887.85.0
63
Gemma-4-31B-it
Google · Apache 2.0 开源
14491462—3485.2—
64
GLM-4.7
Z.ai · MIT 开源国产
14451460—3785.6—
65
GPT-5-high
OpenAI · Proprietary
1444146012323587.19.9
66
Qwen3-Max
Alibaba · Proprietary 国产
14431468—3485.3—
67
Gemma-4-26B-A4B-it
Google · Apache 2.0 开源
14431460—2882.6—
68
Grok-4
xAI · Proprietary
1442145312213586.616.0
69
GLM-4.6
Z.ai · MIT 开源国产
14411458—2883.5—
70
GPT-5.1
OpenAI · Proprietary
1440145012433587.07.5
71
Kimi-K2-Thinking
Moonshot · Modified MIT 开源国产
14381450—3784.8—
72
Claude Sonnet 4.5 (thinking-32k)
Anthropic · Proprietary
14321485—3287.513.6
73
MiMo-V2-Pro
Xiaomi · Proprietary 国产
14311441—3886.8—
74
GLM-4.5
Z.ai · MIT 开源国产
14301448—2683.5—
75
Qwen3-VL-235B-A22B-Instruct
Alibaba · Apache 2.0 开源国产
1429145712462282.8—
76
Mistral Large 3
Mistral · Apache 2.0 开源
14281450—1681.0—
77
ChatGPT-4o-latest (2025-03-26)
OpenAI · Proprietary
1427143412421580.3—
78
DeepSeek-R1-0528
DeepSeek · MIT 开源国产
14261436—2984.91.3
79
Claude Opus 4.1 (thinking-16k)
Anthropic · Proprietary
14251475—3087.8—
80
o3-2025-04-16
OpenAI · Proprietary
1424144112183585.36.5
81
Grok-3-Preview-02-24
xAI · Proprietary
14231439—1879.9—
82
Hunyuan-Hy3
Tencent · Tencent 开源国产
14221448—3586.2—
83
DeepSeek-V3.2-Thinking
DeepSeek · MIT 开源国产
14221438—3586.24.0
84
Gemini-3.1-Flash-Lite
Google · Proprietary
1421140212303186.2—
85
Claude Sonnet 4.5
Anthropic · Proprietary
14201464—2286.0—
86
LongCat-Flash-Chat
Meituan · MIT 开源国产
14201461—2282.7—
87
Claude Opus 4.1
Anthropic · Proprietary
14191465—2187.3—
88
Grok-4-Fast
xAI · Proprietary
14191441—3385.0—
89
Qwen3-235B-A22B-Instruct-2507
Alibaba · Apache 2.0 开源国产
14181457—2282.81.3
90
Nemotron-3-Ultra-550B-A55B
Nvidia · Nvidia Open 开源
14181452—3986.8—
91
DeepSeek-V3.1-Thinking
DeepSeek · MIT 开源国产
14181437—3085.1—
92
DeepSeek-V3.2
DeepSeek · MIT 开源国产
14181431—2583.7—
93
Qwen3-Next-80B-A3B-Instruct
Alibaba · Apache 2.0 开源国产
14171456—2982.4—
94
Amazon-Nova-Chat-11-10
Amazon · Proprietary
14171431—3383.0—
95
DeepSeek-V3.1
DeepSeek · MIT 开源国产
14171430—2183.3—
96
Minimax-M2.7
MiniMax · Non-commercial 国产
14161448—3887.1—
97
Qwen3-235B-A22B-Thinking-2507
Alibaba · Apache 2.0 开源国产
14161442—3384.3—
98
GPT-4.5-Preview
OpenAI · Proprietary
1415141911901681.00.8
99
GPT-5-chat
OpenAI · Proprietary
1413142112383586.67.5
100
Gemini-2.5-Flash
Google · Proprietary
1412142012352883.22.5
分数说明:Arena Elo 为千万级真人盲测对战评分(openlm.ai 聚合,越高越强);AAII 为 Artificial Analysis 智能指数(聚合 MMLU-Pro、GPQA、HLE 等 10 项评测);ARC-AGI 为流体智能解题基准(满分 100);「—」表示该维度暂无数据。数据来源 openlm.ai / lmmarketcap,仅供选型参考。
编辑解读

排行榜的分数从哪来,为什么各家不一样

表里六个维度测的不是同一件事。混在一起看总分,很容易选错模型。

几个维度分别在测什么

  • Arena Elo来自真人盲测对战,两两比较之后算出的相对分。它反映的是「人更愿意用哪个」,不是能力的绝对值。
  • AAII一组标准化任务的综合分。覆盖面广,但每项权重固定,未必贴合你的具体场景。
  • MMLU-Pro知识类选择题,考的是记住了多少,不考会不会用。
  • ARC-AGI抽象推理题,考的是遇到没见过的模式时能不能推出来。

同一模型在不同榜上排名差很多,原因有三个

评测集污染是头一个。公开题目会被训进模型,分数自然虚高,这也是新评测集一发布、老模型分数集体下滑的原因。

提示词敏感是第二个。同一道题换个问法,分数能差十几个点,评测方用的提示模板影响很大。

任务类型是第三个。数学强不代表写作强,代码强不代表长文档处理好,这些能力之间的相关性比很多人想象的低。

怎么用这张表

先想清楚你要干什么,再去看对应维度。写代码盯编程分,做文档处理看知识维度和长文本表现。总分第一的模型,在你的具体场景里未必最优。

成本也得算进去。同样能完成任务的模型,定价可能差几十倍,而排行榜不含价格维度,这一层得自己叠上去。

表中数据来自第三方评测机构,采集时点见页面标注。模型版本更新后分数会变,选型前建议核对一次最新结果。

内容维护 迷你工具站编辑部 · 更新于 2026-09-19