项目: Terminal-Bench Science, 一个面向自然科学计算任务的 AI 智能体基准。

版本: v0.1.0,2026 年 8 月发布。

参与工作: 我是 Terminal-Bench Science v0.1 的主要贡献者之一,我参与的四个任务已被 v0.1 收录。

概述 链接到标题

Terminal-Bench Science 关注 AI 系统能否在终端环境中完成较为真实的科学计算工作流。评测的不只是代码是否看起来合理,也包括智能体能否理解科学问题、完成计算流程,并给出可以检查的结果。

v0.1 中的四个任务 链接到标题

我参与的四个任务覆盖数学优化和机械工程工作流。每个标题都直接链接到 v0.1 标签下对应的 task 文件夹:

我与合作者参与了科学问题表述、任务实现和评测设置。这里暂时只保留概括性的介绍,公开版本的具体内容可以在项目仓库中查看。

为什么重要 链接到标题

AI for Science 需要尽可能贴近科学工作实际过程的评测。一个有用的 benchmark 应该覆盖从理解问题到得到有意义、可检查结果的完整路径,同时也要足够清晰,便于研究者复现和改进。

v0.1 是朝这个方向迈出的第一步。很高兴能在科学计算、优化和 AI 智能体评测的交叉处贡献四个任务示例。

公开链接 链接到标题