Skip to content

Latest commit

 

History

28 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 
 

Repository files navigation

大模型排行榜 · LLM Leaderboard · 模型能力与成本对比

📊 每日自动更新的大模型排行榜(LLM Leaderboard):聚合 Arena 人类盲测偏好与 OpenRouter 定价,

数据源:17nas.com | 本仓库抓取于 2026-10-02

Hugging Face 镜像:datasets/AmigaMeow/llm-leaderboard —— 不用克隆,可直接 load_dataset() 读取

⚠️ 其中 Arena 分数取自 LMArena 快照 2026-09-30(上游自该日起未发布新快照); 定价、上下文长度与收录名单为每日抓取。

Daily Update License: MIT Hugging Face Dataset

涵盖 闭源商用模型(GPT / Claude / Gemini / Grok / Qwen / GLM / Kimi …)与 开源权重模型 (Llama / DeepSeek / Qwen / GLM / Mistral / MiniMax …),可按能力、价格、预算档位与上下文长度对比。


快照概览

指标 值
收录模型 79
有 Arena 评分 52
有定价数据 69
开源权重 22
覆盖厂商 19
数据源 lmarena ok
最近抓取 2026-10-02
Arena 榜发布日 2026-09-30

厂商分布:OpenAI (14)、Anthropic (11)、Google (9)、Alibaba (8)、DeepSeek (6)、Xiaomi (4)


榜单索引(5 个维度的模型对比)

榜单 说明 完整榜
Overall Arena human preference 查看
Pick by budget Strongest model in each price band 查看
Lowest price Blended price ascending 查看
Long context Maximum context window 查看
Open weights Open-weight models only 查看

📈 榜单可视化

Arena Top 10

Arena Top 10 by price band

图表随主题自动切换明暗;由 scripts/render_charts.py 每日生成。


🏆 综合榜 Top 10:Arena 人类偏好评分的模型排名

# Model Org Arena Votes
🥇 Gemini 4 Argon Google 1,533.1 4,942
🥈 Claude Opus 5.5 Anthropic 1,512.0 3,932
🥉 Claude Fable 5.1 Anthropic 1,510.7 11,241
4 Claude Opus 5 Anthropic 1,506.5 28,351
5 Claude Opus 4.6 Anthropic 1,503.8 77,193
6 Gemini 3.8 Flash Google 1,496.1 24,828
7 MiMo-V2.6-Pro Xiaomi 1,490.5 4,074
8 Claude Opus 4.7 Anthropic 1,490.3 64,607
9 Muse Spark 1.3 Meta 1,490.2 11,698
10 Gemini 3.7 Flash Google 1,487.5 20,851

→ 完整综合榜

💰 按预算选:每档价格里最强的模型

回答的是「我预算 $X/百万 token,该用哪个」。Gap to #1 是相对榜首丢掉的 Arena 分数。

Budget Strongest model Org Weights Arena Gap to #1 Price
$0.00–0.10 DeepSeek V4 Flash DeepSeek open 1,432.0 80.0 $0.053
$0.10–0.25 GLM-5.3 Flash Z.AI open 1,470.5 41.5 $0.237
$0.25–0.50 DeepSeek V4 Pro DeepSeek open 1,451.0 61.0 $0.261
$0.50–1.00 MiMo-V2.6-Pro Xiaomi open 1,490.5 21.5 $0.544
$1.00–3.00 Gemini 3.8 Flash Google closed 1,496.1 15.9 $1.50
$3.00–10.00 Claude Opus 5.5 Anthropic closed 1,512.0 — $8.00
$10+ Claude Fable 5.1 Anthropic closed 1,510.7 1.3 $20.00

→ 完整预算榜

📄 长上下文榜 Top 10:最大上下文窗口的模型

# Model Org Context Arena Blended
🥇 Grok 4.20 xAI 2.0M - $1.56
🥈 MiMo-V2.6-Pro Xiaomi 1.1M 1,490.5 $0.544
🥉 GPT-5.5 OpenAI 1.1M 1,471.2 $11.25
4 GPT-5.4 OpenAI 1.1M 1,468.9 $5.62
5 MiMo V2.5 Pro Xiaomi 1.1M 1,464.8 $0.544
6 MiMo-V2.6-Flash Xiaomi 1.1M 1,458.4 $0.175
7 GPT-5.6 Sol OpenAI 1.1M 1,456.1 $4.00
8 GPT-5.6 Terra OpenAI 1.1M 1,446.0 $4.50
9 GPT-5.6 Luna OpenAI 1.1M 1,431.5 $0.450
10 MiMo V2.5 Xiaomi 1.1M 1,427.6 $0.175

→ 完整长上下文榜


数据说明

  • Arena 分数:LMArena 人类盲测的 Bradley-Terry 评分,附 95% 置信区间。两个模型的区间重叠时,名次差异不必过度解读。
  • 票数:参与投票的样本量。票数越高,分数越稳定。
  • 价格:OpenRouter 公开定价,单位美元 / 百万 token;混合价格按输入:输出 = 3:1 加权。
  • 涨跌:与上一份快照的名次对比。NEW = 新进榜。

常见问题

这是什么榜单? 一个每日自动更新的大模型排行榜,用 Arena 人类盲测偏好衡量模型能力,用 OpenRouter 公开定价衡量成本。

排名依据什么? 综合榜按 LMArena 的 Bradley-Terry 评分(人类盲测胜率推导)排序,并给出 95% 置信区间。

为什么不做「性价比分数」? 试过,但 Arena 分数跨距只有约 6%,而价格跨距高达数百倍, 两者相除会退化成价格榜(实测 86% 同序)。所以改为按价格分档取最强者 —— 这更贴近真实决策。

为什么两个模型分数接近时不宜直接比名次? 因为评分带有置信区间。区间重叠时,名次差异可能只是采样波动。

数据多久更新一次? 每日一次,由 GitHub Actions 自动拉取并提交;历史快照保留在 data/history/。

可以商用或二次分发吗? 生成代码为 MIT;Arena 数据为 CC-BY-4.0(需署名);请勿再分发 Artificial Analysis 数据。

更新机制

本仓库由 GitHub Actions 每日自动更新:拉取聚合数据 → 生成榜单 → 提交。 历史快照保存在 data/history/,可用于回溯任意一天的榜单。

相关项目

项目 说明
llm-benchmark-leaderboard 自托管的排行榜程序(PHP + 无数据库依赖),可基于本仓库的数据自行部署
cpu-benchmark-leaderboard 自托管的 CPU 性能天梯榜
17nas.com/llm-leaderboard.php 在线版榜单(含更多维度与历史趋势)

许可与数据条款

  • 本仓库的榜单生成代码以 MIT 许可开放。
  • Arena 评分来自 LMArena(CC-BY-4.0 数据集),价格数据来自 OpenRouter 公开 API。
  • 本仓库不包含 Artificial Analysis 的数据:其 Terms of Use 明确禁止再分发,故未纳入。
  • 完整的条款核查记录(含条款原文引用)见 docs/UPSTREAM-TOS.md。
  • 原始榜单与更多维度:17nas.com/llm-leaderboard.php

本页由 scripts/render_readme.py 自动生成,请勿手工编辑。

About

每日自动更新的大模型排行榜(LLM Leaderboard):聚合 LMArena 人类盲测偏好与 OpenRouter 定价,含综合榜、按预算选型榜、价格榜、长上下文榜、开源权重榜 5 个维度。

Topics

Resources

Stars

3 stars

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages