实时
Epoch Capabilities Index
ECI将多项公开评测拟合到同一能力尺度,适合作为通用能力基准。
- 运营方
- Epoch AI
- 分类
- 通用
- 模型数
- 60
- 数据时间
- 2026/08/20 02:56
实时模型榜的数据来源、归并规则、评分方式和失效处理。
这不是又一张手工打分表。每个分数都能回到公开榜单的原始名次和成绩;来源停止更新或连续抓取失败后,会明确显示缓存或过期状态。
01 · SCORING
每张榜按名次换算为 0–100 分。榜首为 100,榜尾为 0,保留原始成绩供核对。
同一机构如果有多张榜,先算组内平均,避免一家来源通过增加榜单放大权重。
再对独立来源求平均得到共识分。进入总榜至少需要 2 个独立来源。
02 · SOURCES
ECI将多项公开评测拟合到同一能力尺度,适合作为通用能力基准。
WEB基于匿名两两比较的 Web 开发结果,反映页面生成与前端完成度。
SWE在统一 mini-swe-agent harness 下比较代码模型,减少 Agent 外壳差异。
TERM评估模型和 Agent 在真实终端环境中完成端到端工程任务的能力。
APEX衡量模型在投行、咨询和法律等长链路知识工作中的 Agent 表现。
ARENA匿名两两盲选形成的人类偏好排名,补充客观题库难以覆盖的回答体验。
03 · FRESHNESS
自动更新 GitHub Actions 每 6 小时拉取一次。上游数据没有变化时不产生无意义提交。
失败回退 单个来源暂时失败时保留最近一次成功数据并标为“缓存”;超过 72 小时仍未恢复则标为“过期”,不再参与计算。
版本归并 同一基础模型的 thinking level、日期后缀和评测 harness 版本会归并,详情页仍保留上游原始模型名。
Epoch 榜单数据通过其公开 Benchmarking Hub 数据包获取,并保留每张原始榜单链接。Artificial Analysis 只有在部署环境配置官方 API Key 后才接入;没有实时接口时,页面不会展示手工价格。
Epoch 数据说明 Artificial Analysis API