📊 每日自动更新的大模型排行榜(LLM Leaderboard):聚合 Arena 人类盲测偏好与 OpenRouter 定价,
数据源:17nas.com | 本仓库抓取于 2026-10-02
Hugging Face 镜像:datasets/AmigaMeow/llm-leaderboard —— 不用克隆,可直接
load_dataset()读取
⚠️ 其中 Arena 分数取自 LMArena 快照 2026-09-30(上游自该日起未发布新快照); 定价、上下文长度与收录名单为每日抓取。
涵盖 闭源商用模型(GPT / Claude / Gemini / Grok / Qwen / GLM / Kimi …)与 开源权重模型 (Llama / DeepSeek / Qwen / GLM / Mistral / MiniMax …),可按能力、价格、预算档位与上下文长度对比。
| 指标 | 值 |
|---|---|
| 收录模型 | 79 |
| 有 Arena 评分 | 52 |
| 有定价数据 | 69 |
| 开源权重 | 22 |
| 覆盖厂商 | 19 |
| 数据源 | lmarena ok |
| 最近抓取 | 2026-10-02 |
| Arena 榜发布日 | 2026-09-30 |
厂商分布:OpenAI (14)、Anthropic (11)、Google (9)、Alibaba (8)、DeepSeek (6)、Xiaomi (4)
| 榜单 | 说明 | 完整榜 |
|---|---|---|
| Overall | Arena human preference | 查看 |
| Pick by budget | Strongest model in each price band | 查看 |
| Lowest price | Blended price ascending | 查看 |
| Long context | Maximum context window | 查看 |
| Open weights | Open-weight models only | 查看 |
图表随主题自动切换明暗;由
scripts/render_charts.py每日生成。
| # | Model | Org | Arena | Votes |
|---|---|---|---|---|
| 🥇 | Gemini 4 Argon | 1,533.1 | 4,942 | |
| 🥈 | Claude Opus 5.5 | Anthropic | 1,512.0 | 3,932 |
| 🥉 | Claude Fable 5.1 | Anthropic | 1,510.7 | 11,241 |
| 4 | Claude Opus 5 | Anthropic | 1,506.5 | 28,351 |
| 5 | Claude Opus 4.6 | Anthropic | 1,503.8 | 77,193 |
| 6 | Gemini 3.8 Flash | 1,496.1 | 24,828 | |
| 7 | MiMo-V2.6-Pro | Xiaomi | 1,490.5 | 4,074 |
| 8 | Claude Opus 4.7 | Anthropic | 1,490.3 | 64,607 |
| 9 | Muse Spark 1.3 | Meta | 1,490.2 | 11,698 |
| 10 | Gemini 3.7 Flash | 1,487.5 | 20,851 |
回答的是「我预算 $X/百万 token,该用哪个」。Gap to #1 是相对榜首丢掉的 Arena 分数。
| Budget | Strongest model | Org | Weights | Arena | Gap to #1 | Price |
|---|---|---|---|---|---|---|
| $0.00–0.10 | DeepSeek V4 Flash | DeepSeek | open | 1,432.0 | 80.0 | $0.053 |
| $0.10–0.25 | GLM-5.3 Flash | Z.AI | open | 1,470.5 | 41.5 | $0.237 |
| $0.25–0.50 | DeepSeek V4 Pro | DeepSeek | open | 1,451.0 | 61.0 | $0.261 |
| $0.50–1.00 | MiMo-V2.6-Pro | Xiaomi | open | 1,490.5 | 21.5 | $0.544 |
| $1.00–3.00 | Gemini 3.8 Flash | closed | 1,496.1 | 15.9 | $1.50 | |
| $3.00–10.00 | Claude Opus 5.5 | Anthropic | closed | 1,512.0 | — | $8.00 |
| $10+ | Claude Fable 5.1 | Anthropic | closed | 1,510.7 | 1.3 | $20.00 |
| # | Model | Org | Context | Arena | Blended |
|---|---|---|---|---|---|
| 🥇 | Grok 4.20 | xAI | 2.0M | - | $1.56 |
| 🥈 | MiMo-V2.6-Pro | Xiaomi | 1.1M | 1,490.5 | $0.544 |
| 🥉 | GPT-5.5 | OpenAI | 1.1M | 1,471.2 | $11.25 |
| 4 | GPT-5.4 | OpenAI | 1.1M | 1,468.9 | $5.62 |
| 5 | MiMo V2.5 Pro | Xiaomi | 1.1M | 1,464.8 | $0.544 |
| 6 | MiMo-V2.6-Flash | Xiaomi | 1.1M | 1,458.4 | $0.175 |
| 7 | GPT-5.6 Sol | OpenAI | 1.1M | 1,456.1 | $4.00 |
| 8 | GPT-5.6 Terra | OpenAI | 1.1M | 1,446.0 | $4.50 |
| 9 | GPT-5.6 Luna | OpenAI | 1.1M | 1,431.5 | $0.450 |
| 10 | MiMo V2.5 | Xiaomi | 1.1M | 1,427.6 | $0.175 |
- Arena 分数:LMArena 人类盲测的 Bradley-Terry 评分,附 95% 置信区间。两个模型的区间重叠时,名次差异不必过度解读。
- 票数:参与投票的样本量。票数越高,分数越稳定。
- 价格:OpenRouter 公开定价,单位美元 / 百万 token;混合价格按输入:输出 = 3:1 加权。
- 涨跌:与上一份快照的名次对比。NEW = 新进榜。
这是什么榜单? 一个每日自动更新的大模型排行榜,用 Arena 人类盲测偏好衡量模型能力,用 OpenRouter 公开定价衡量成本。
排名依据什么? 综合榜按 LMArena 的 Bradley-Terry 评分(人类盲测胜率推导)排序,并给出 95% 置信区间。
为什么不做「性价比分数」? 试过,但 Arena 分数跨距只有约 6%,而价格跨距高达数百倍, 两者相除会退化成价格榜(实测 86% 同序)。所以改为按价格分档取最强者 —— 这更贴近真实决策。
为什么两个模型分数接近时不宜直接比名次? 因为评分带有置信区间。区间重叠时,名次差异可能只是采样波动。
数据多久更新一次? 每日一次,由 GitHub Actions 自动拉取并提交;历史快照保留在 data/history/。
可以商用或二次分发吗? 生成代码为 MIT;Arena 数据为 CC-BY-4.0(需署名);请勿再分发 Artificial Analysis 数据。
本仓库由 GitHub Actions 每日自动更新:拉取聚合数据 → 生成榜单 → 提交。
历史快照保存在 data/history/,可用于回溯任意一天的榜单。
| 项目 | 说明 |
|---|---|
| llm-benchmark-leaderboard | 自托管的排行榜程序(PHP + 无数据库依赖),可基于本仓库的数据自行部署 |
| cpu-benchmark-leaderboard | 自托管的 CPU 性能天梯榜 |
| 17nas.com/llm-leaderboard.php | 在线版榜单(含更多维度与历史趋势) |
- 本仓库的榜单生成代码以 MIT 许可开放。
- Arena 评分来自 LMArena(CC-BY-4.0 数据集),价格数据来自 OpenRouter 公开 API。
- 本仓库不包含 Artificial Analysis 的数据:其 Terms of Use 明确禁止再分发,故未纳入。
- 完整的条款核查记录(含条款原文引用)见 docs/UPSTREAM-TOS.md。
- 原始榜单与更多维度:17nas.com/llm-leaderboard.php
本页由 scripts/render_readme.py 自动生成,请勿手工编辑。