BENCHMARK CATALOG / 002
先认识
尺子。
每一个分数背后都有一套题目、协议和判定器。这里把评测本身拆开讲清楚:它测什么、适合回答什么问题,以及哪些结果不能直接横比。
CATALOG PRINCIPLE01
定义先于排名
目录记录 benchmark 的身份与口径;矩阵才展示模型成绩。不同版本、指标和 harness 默认不合并。
点击卡片查看完整 profile、来源与比较提醒。
01 / CATALOG
Benchmark directory
按能力面、评估模式或指标筛选;包含 canonical benchmark 与公开来源切片。卡片中的数字只是目录信息,不是跨 benchmark 的总排名。
— / — benchmarks
没有匹配的 benchmark
试试清空搜索词,或放宽筛选条件。
02 / HOW TO READ
别把不同的尺子
刻度相加。
准确率、Pass@1、Elo、成功率和 Agent 系统得分回答的是不同问题。详情页会把评测对象(模型还是系统)、版本、指标方向、工具和 harness 条件放在同一处,方便你在比较前先检查口径。
01Identify版本 / split / owner
→
02Comparemetric / protocol / harness
→
03Inspect来源 / snapshot / caveat