跳转到内容

模型榜评分方法

实时模型榜的数据来源、归并规则、评分方式和失效处理。

这不是又一张手工打分表。每个分数都能回到公开榜单的原始名次和成绩;来源停止更新或连续抓取失败后,会明确显示缓存或过期状态。

5独立来源6当前榜单

01 · SCORING

共识分怎么计算

  1. 01
    榜内归一

    每张榜按名次换算为 0–100 分。榜首为 100,榜尾为 0,保留原始成绩供核对。

  2. 02
    运营方去重

    同一机构如果有多张榜,先算组内平均,避免一家来源通过增加榜单放大权重。

  3. 03
    跨来源平均

    再对独立来源求平均得到共识分。进入总榜至少需要 2 个独立来源。

02 · SOURCES

当前接入的数据源

实时

Epoch Capabilities Index

ECI

将多项公开评测拟合到同一能力尺度,适合作为通用能力基准。

运营方
Epoch AI
分类
通用
模型数
60
数据时间
2026/08/20 02:56
查看原始榜单 ↗
实时

Arena WebDev

WEB

基于匿名两两比较的 Web 开发结果,反映页面生成与前端完成度。

运营方
Arena
分类
代码
模型数
60
数据时间
2026/08/19 09:55
查看原始榜单 ↗
实时

DeepSWE v1.1

SWE

在统一 mini-swe-agent harness 下比较代码模型,减少 Agent 外壳差异。

运营方
DataCurve
分类
代码
模型数
21
数据时间
2026/08/19 03:00
查看原始榜单 ↗
实时

Terminal-Bench 2.0

TERM

评估模型和 Agent 在真实终端环境中完成端到端工程任务的能力。

运营方
Terminal-Bench
分类
Agent
模型数
44
数据时间
2026/08/11 23:47
查看原始榜单 ↗
实时

APEX-Agents

APEX

衡量模型在投行、咨询和法律等长链路知识工作中的 Agent 表现。

运营方
APEX-Agents
分类
Agent
模型数
51
数据时间
2026/08/19 09:55
查看原始榜单 ↗
实时

Arena Text

ARENA

匿名两两盲选形成的人类偏好排名,补充客观题库难以覆盖的回答体验。

运营方
Arena
分类
通用
模型数
60
数据时间
2026/08/22 09:53
查看原始榜单 ↗

03 · FRESHNESS

实时性和失败处理

自动更新 GitHub Actions 每 6 小时拉取一次。上游数据没有变化时不产生无意义提交。

失败回退 单个来源暂时失败时保留最近一次成功数据并标为“缓存”;超过 72 小时仍未恢复则标为“过期”,不再参与计算。

版本归并 同一基础模型的 thinking level、日期后缀和评测 harness 版本会归并,详情页仍保留上游原始模型名。

Epoch 榜单数据通过其公开 Benchmarking Hub 数据包获取,并保留每张原始榜单链接。Artificial Analysis 只有在部署环境配置官方 API Key 后才接入;没有实时接口时,页面不会展示手工价格。

Epoch 数据说明 Artificial Analysis API