Hans Mittelmann Benchmarks
它不是一个实例库。每个赛道、日期、机器与协议必须拆成独立 campaign;商业结果撤回或停止发布要保留具体原因。
实例库、竞赛、持续跑榜、生成器和历史档案分别建模。默认按影响力层级和可核验信号排序,不制造伪精确总分。
Impact tier 看历史地位、机构治理、采用和维护年限;Evidence readiness R0–R3 看协议、checker、版本、日志、硬件和公开实例是否足够完整。
它不是一个实例库。每个赛道、日期、机器与协议必须拆成独立 campaign;商业结果撤回或停止发布要保留具体原因。
系列页只是 archive 导航;禁止合并不同届的规则或结果。
问题名不足以唯一确定实例;参数化维度、decoder 和起点都必须进入 instance_set。
适合作为实例与参考解来源,性能结果仍必须来自固定 campaign。
连接通用 NLP/MINLP 与电力系统应用赛道的关键库。
连接 QP、MIQP、QCQP、MIQCQP 和 QUBO taxonomy 的核心集合。
第六代 MIPLIB,也是建立高证据等级 MILP campaign 的首选实例快照。
普通 collection 与 BKS Challenge 是相关但不同的实体。
必须按子集合拆 profile,不能把异构格式和结果视为一个 suite。
价值在历史可比性,不代表现代超大规模 LP 的难度分布。
凸 QP active-set 与 interior-point 研究的经典公共基线。
距离类型是协议的一部分;不能默认按欧氏距离重新计算。
不同 division、single-core 与 parallel 绝不合并。
每届、每阶段、public/hidden set 和 checker 版本分别建模。
易接入实验入口,但不是 CUTEst 之外的新问题来源。
network、nomination/scenario 与 schema version 都是快照键。
格式与解覆盖异构,需逐子集合 ingest。
SOCP/MISOCP 的专门实例与格式入口。
保留 topology、traffic model 和来源元数据。
重要 legacy archive,许可和站点可用性需持续监测。
按 single-mode、multi-mode 与 resource-investment 分开。
应作为 network design 专赛道,而不是笼统 MILP。
QPLIB 之外更专注组合二次优化的基线。
维护较弱但仍是 QAP 算法比较事实标准。
BPP 与 CSP 是相邻但不同的赛道。
它是异构 archive 聚合器,不是单一同质 suite。
预算与 target-based curves 是主轴,不能用 OR solved-count 表替代。
适合作为 MPEC 专门 profile,而不是一般 NLP 排名。
不同年份函数、维度、预算和评分不可合并。
历史影响大但规模和现代代表性有限。
评价需包含 hypervolume/IGD 与 reference front,不等同单目标 gap。
用于补足大规模结构化 NLP,但协议和维护弱于 CUTEst。
应按函数评估预算、维度和起点生成 data profiles。
Impact tier A→B→C → 已核验影响力信号数 → 覆盖广度 → 最近核验日期。这里没有隐藏总分。