Frontier Model Bench 一个可追溯的模型评测索引
catalog snapshot

BENCHMARK CATALOG / 002

先认识
尺子。

每一个分数背后都有一套题目、协议和判定器。这里把评测本身拆开讲清楚:它测什么、适合回答什么问题,以及哪些结果不能直接横比。

CATALOG PRINCIPLE01
定义先于排名

目录记录 benchmark 的身份与口径;矩阵才展示模型成绩。不同版本、指标和 harness 默认不合并。

点击卡片查看完整 profile、来源与比较提醒。
TRACKED / PUBLIC SLICEScanonical 与公开来源切片
CAPABILITY AREAS能力面 / 家族
REGISTERED SOURCES目录登记的可追溯来源
ACTIVE VERSIONS当前版本

01 / CATALOG

Benchmark directory

按能力面、评估模式或指标筛选;包含 canonical benchmark 与公开来源切片。卡片中的数字只是目录信息,不是跨 benchmark 的总排名。

/ benchmarks

02 / HOW TO READ

别把不同的尺子
刻度相加。

准确率、Pass@1、Elo、成功率和 Agent 系统得分回答的是不同问题。详情页会把评测对象(模型还是系统)、版本、指标方向、工具和 harness 条件放在同一处,方便你在比较前先检查口径。

model ≠ systemversionedmetric-awaremissing ≠ zero
01Identify版本 / split / owner
02Comparemetric / protocol / harness
03Inspect来源 / snapshot / caveat