项目: Terminal-Bench Science, 一个面向自然科学计算任务的 AI 智能体基准。
版本: v0.1.0,2026 年 8 月发布。
参与工作: 我是 Terminal-Bench Science v0.1 的主要贡献者之一,我参与的四个任务已被 v0.1 收录。
概述 链接到标题
Terminal-Bench Science 关注 AI 系统能否在终端环境中完成较为真实的科学计算工作流。评测的不只是代码是否看起来合理,也包括智能体能否理解科学问题、完成计算流程,并给出可以检查的结果。
v0.1 中的四个任务 链接到标题
我参与的四个任务覆盖数学优化和机械工程工作流。每个标题都直接链接到 v0.1 标签下对应的 task 文件夹:
- Noisy Black-Box Optimization:在函数评估次数有限且带有噪声的情况下进行优化。
- Guided-Wave Damage Localization:利用导波测量信息定位结构损伤。
- Baseline-Free Guided-Wave Damage Localization:在没有完好参考测量的情况下处理类似的定位问题。
- Virtual-Baseline Crack Localization:在裂纹定位流程中使用由仿真提供参考的信息。
我与合作者参与了科学问题表述、任务实现和评测设置。这里暂时只保留概括性的介绍,公开版本的具体内容可以在项目仓库中查看。
为什么重要 链接到标题
AI for Science 需要尽可能贴近科学工作实际过程的评测。一个有用的 benchmark 应该覆盖从理解问题到得到有意义、可检查结果的完整路径,同时也要足够清晰,便于研究者复现和改进。
v0.1 是朝这个方向迈出的第一步。很高兴能在科学计算、优化和 AI 智能体评测的交叉处贡献四个任务示例。